首页 web前端 js教程 测试 LLM 应用程序:模拟 SDK 与直接 HTTP 请求中的不幸事件

测试 LLM 应用程序:模拟 SDK 与直接 HTTP 请求中的不幸事件

Dec 04, 2024 am 11:03 AM

Testing LLM Applications: Misadventures in Mocking SDKs vs Direct HTTP Requests

介绍

让我在这篇博客的前言中说,这个与我的其他博客不同,在这些博客中我能够逐步完成完成任务的步骤。相反,这更多地反映了我在尝试向我的项目 gimme_readme 添加测试时遇到的挑战,以及我在此过程中学到的关于测试 LLM 支持的应用程序的知识。

背景

本周,我和我的开源开发同学的任务是向包含大型语言模型 (LLM) 的命令行工具添加测试。乍一看这似乎很简单,但它让我陷入了一个我没有预料到的测试复杂性的兔子洞。

我的测试之旅

最初的方法

当我第一次构建 gimme_readme 时,我使用 Jest.js 添加了一些基本测试。这些测试相当简单,主要关注:

  • 验证函数输出
  • 检查基本错误处理
  • 测试简单的实用函数

虽然这些测试提供了一些覆盖范围,但它们并没有测试我的申请中最关键的部分之一:LLM 交互。

挑战:测试 LLM 交互

当我尝试添加更全面的测试时,我对我的应用程序如何与法学硕士进行通信有了一个有趣的认识。最初,我认为可以使用 Nock.js 来模拟对这些语言模型的 HTTP 请求。毕竟,这就是 Nock 的擅长之处 - 拦截和模拟 HTTP 请求以进行测试。

但是,我发现我使用LLM的方式让我很难使用Nock编写测试。

SDK 与直接 HTTP 请求的困境

这就是事情变得有趣的地方。我的应用程序使用由 LLM 服务(例如 Google 的 Gemini 和 Groq)提供的官方 SDK 客户端。这些 SDK 充当抽象层,在幕后处理所有 HTTP 通信。虽然这使得代码更干净、更容易在生产中使用,但它带来了有趣的测试挑战。

考虑这两种实现 LLM 功能的方法:

// Approach 1: Using SDK
const groq = new Groq({ apiKey });
const response = await groq.chat.completions.create({
  messages: [{ role: "user", content: prompt }],
  model: "mixtral-8x7b-32768"
});

// Approach 2: Direct HTTP requests
const response = await fetch('https://api.groq.com/v1/completions', {
  method: 'POST',
  headers: {
    'Authorization': `Bearer ${apiKey}`,
    'Content-Type': 'application/json'
  },
  body: JSON.stringify({
    messages: [{ role: "user", content: prompt }],
    model: "mixtral-8x7b-32768"
  })
});
登录后复制

SDK 方法更简洁,并提供更好的开发人员体验,但它使得 Nock 等传统 HTTP 模拟工具不太有用。 HTTP 请求发生在 SDK 内部,这使得它们更难被 Nock 拦截

经验教训

  1. 尽早考虑测试策略:在 SDK 和直接 HTTP 请求之间进行选择时,请考虑如何测试实现。有时“更干净”的生产代码可能会使测试更具挑战性。

  2. SDK 测试需要不同的工具:使用 SDK 时,需要在 SDK 级别而不是 HTTP 级别进行模拟。这意味着:

    • 模拟整个 SDK 客户端
    • 专注于 SDK 的接口而不是 HTTP 请求
    • 使用 Jest 的模块模拟​​功能而不是 HTTP 拦截器
  3. 便利性和可测试性之间的平衡:虽然 SDK 提供了出色的开发人员体验,但它们可能会使某些测试方法变得更加困难。在构建应用程序时值得考虑这种权衡。

前进

虽然我还没有完全解决我的测试挑战,但这段经历教会了我关于通过 SDK 测试依赖于外部服务的应用程序的宝贵经验。对于构建类似应用程序的任何人,我建议:

  1. 在 SDK 和直接 API 调用之间进行选择时考虑测试策略
  2. 如果使用 SDK,请计划在 SDK 级别而不是 HTTP 级别进行模拟
  3. 考虑在 SDK 周围编写薄包装器,使它们更易于测试
  4. 为可能参与该项目的其他人记录测试方法

结论

测试 LLM 应用程序带来了独特的挑战,特别是在平衡 SDK 等现代开发便利性与彻底测试的需要时。虽然我仍在努力提高 gimme_readme 的测试覆盖率,但这次经历让我更好地了解了如何在涉及外部服务和 SDK 的未来项目中进行测试。

还有其他人在测试使用 LLM SDK 的应用程序时遇到过类似的挑战吗?我很想在评论中听到您的经验和解决方案!

以上是测试 LLM 应用程序:模拟 SDK 与直接 HTTP 请求中的不幸事件的详细内容。更多信息请关注PHP中文网其他相关文章!

本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

<🎜>:泡泡胶模拟器无穷大 - 如何获取和使用皇家钥匙
3 周前 By 尊渡假赌尊渡假赌尊渡假赌
北端:融合系统,解释
3 周前 By 尊渡假赌尊渡假赌尊渡假赌
Mandragora:巫婆树的耳语 - 如何解锁抓钩
3 周前 By 尊渡假赌尊渡假赌尊渡假赌

热工具

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

热门话题

Java教程
1666
14
CakePHP 教程
1426
52
Laravel 教程
1328
25
PHP教程
1273
29
C# 教程
1253
24
JavaScript引擎:比较实施 JavaScript引擎:比较实施 Apr 13, 2025 am 12:05 AM

不同JavaScript引擎在解析和执行JavaScript代码时,效果会有所不同,因为每个引擎的实现原理和优化策略各有差异。1.词法分析:将源码转换为词法单元。2.语法分析:生成抽象语法树。3.优化和编译:通过JIT编译器生成机器码。4.执行:运行机器码。V8引擎通过即时编译和隐藏类优化,SpiderMonkey使用类型推断系统,导致在相同代码上的性能表现不同。

Python vs. JavaScript:学习曲线和易用性 Python vs. JavaScript:学习曲线和易用性 Apr 16, 2025 am 12:12 AM

Python更适合初学者,学习曲线平缓,语法简洁;JavaScript适合前端开发,学习曲线较陡,语法灵活。1.Python语法直观,适用于数据科学和后端开发。2.JavaScript灵活,广泛用于前端和服务器端编程。

从C/C到JavaScript:所有工作方式 从C/C到JavaScript:所有工作方式 Apr 14, 2025 am 12:05 AM

从C/C 转向JavaScript需要适应动态类型、垃圾回收和异步编程等特点。1)C/C 是静态类型语言,需手动管理内存,而JavaScript是动态类型,垃圾回收自动处理。2)C/C 需编译成机器码,JavaScript则为解释型语言。3)JavaScript引入闭包、原型链和Promise等概念,增强了灵活性和异步编程能力。

JavaScript和Web:核心功能和用例 JavaScript和Web:核心功能和用例 Apr 18, 2025 am 12:19 AM

JavaScript在Web开发中的主要用途包括客户端交互、表单验证和异步通信。1)通过DOM操作实现动态内容更新和用户交互;2)在用户提交数据前进行客户端验证,提高用户体验;3)通过AJAX技术实现与服务器的无刷新通信。

JavaScript在行动中:现实世界中的示例和项目 JavaScript在行动中:现实世界中的示例和项目 Apr 19, 2025 am 12:13 AM

JavaScript在现实世界中的应用包括前端和后端开发。1)通过构建TODO列表应用展示前端应用,涉及DOM操作和事件处理。2)通过Node.js和Express构建RESTfulAPI展示后端应用。

了解JavaScript引擎:实施详细信息 了解JavaScript引擎:实施详细信息 Apr 17, 2025 am 12:05 AM

理解JavaScript引擎内部工作原理对开发者重要,因为它能帮助编写更高效的代码并理解性能瓶颈和优化策略。1)引擎的工作流程包括解析、编译和执行三个阶段;2)执行过程中,引擎会进行动态优化,如内联缓存和隐藏类;3)最佳实践包括避免全局变量、优化循环、使用const和let,以及避免过度使用闭包。

Python vs. JavaScript:社区,图书馆和资源 Python vs. JavaScript:社区,图书馆和资源 Apr 15, 2025 am 12:16 AM

Python和JavaScript在社区、库和资源方面的对比各有优劣。1)Python社区友好,适合初学者,但前端开发资源不如JavaScript丰富。2)Python在数据科学和机器学习库方面强大,JavaScript则在前端开发库和框架上更胜一筹。3)两者的学习资源都丰富,但Python适合从官方文档开始,JavaScript则以MDNWebDocs为佳。选择应基于项目需求和个人兴趣。

Python vs. JavaScript:开发环境和工具 Python vs. JavaScript:开发环境和工具 Apr 26, 2025 am 12:09 AM

Python和JavaScript在开发环境上的选择都很重要。1)Python的开发环境包括PyCharm、JupyterNotebook和Anaconda,适合数据科学和快速原型开发。2)JavaScript的开发环境包括Node.js、VSCode和Webpack,适用于前端和后端开发。根据项目需求选择合适的工具可以提高开发效率和项目成功率。

See all articles