LLM 评分系统改了 Prompt,然后懵了:Eval 工程实践
评分系统的 prompt 改了一版,分数好像变了,评语语气也不太对。但"好像"这个词在生产环境里是不及格的——到底是变好还是变差?哪个维度?多少 case 受影响?我们完全不知道。为了不再盲人摸象,我们花了一周调研工具、对比平台、踩坑选型,最终搭起了自己的 eval 体系。
为什么我们需要 LLM Eval?
我们在做一个 LLM 评分系统——用大模型给考试打分的那种。
系统已经能跑了。模型在读对话、写评语、给分数,看起来挺像那么回事。然后我们改了一版 prompt。改完之后,分数好像变了,评语的语气也不太一样了。
但"好像"这个词让我们很不舒服。到底是变好了还是变差了?哪个维度变了?有多少 case 受影响?
我们发现自己在一个很尴尬的处境:系统在线上跑着,但我们完全不知道它的质量在往哪个方向走。 这不是技术问题,是工程问题。Prompt 写好了,怎么知道好不好?
AI 产品需要关注哪七个维度?
带着这个问题,我们做了一次系统性的调研,最终梳理出 AI 产品需要关注的七个维度:
- 选模型 — 用哪个 LLM
- 写 Prompt — 怎么写、怎么管、怎么迭代
- 输出质量 — 结果对不对、好不好
- 成本 — API 花了多少钱
- 速度 — 用户等多久
- 稳定性 — 系统靠不靠谱
- 安全 — 幻觉、偏见、数据泄露
每个维度都有 MVP 和规模化两个层次。比如输出质量,MVP 就是准备 20 条 golden set 手动检查;规模化就得上 LLM-as-Judge + 自动 eval pipeline + CI 门禁。
我们的观点是:MVP 先做 Quality + Safety 最小集,其他维度按需扩展。 大部分团队什么都不做就上线了——先能观测到问题,再谈优化。
七个维度里,我们最关心的是第三个——输出质量。对于评分系统来说,质量就是一切。
LangFuse、Braintrust、Datadog 三个平台怎么选?
确定了要建 eval 体系之后,下一步是选工具。这个过程比想象的纠结。
LangFuse:默认选择,但 Eval 体验一般
最先看的是 LangFuse。它在 LLM 可观测性领域几乎是默认选择——GitHub 15k+ stars,2025 年被 ClickHouse 以 $400M 收购,Khan Academy、Canva 都在用。
Tracing 做得确实好。每次 LLM 调用的 input、output、token 数、latency、cost 全记录,按用户、会话、prompt 版本筛选。Prompt Management 也有——在 UI 里管 prompt 版本,SDK 自动缓存,改 prompt 不用改代码重新部署。
但 eval 部分,老实说体验一般。你要写几行代码才能跑一个 experiment,不像有些平台那样一个页面点点就能对比。
Braintrust:Eval 体验好,但更像实验室
然后看了 Braintrust。这家刚拿了 $80M Series B,定位是"评估优先"。
Braintrust 的 eval 体验确实更好——一个页面跑 experiment 对比,Playground 做得好,免费 tier 也大方:1M spans/月、无限用户。但它的生产监控不如 LangFuse,更像个实验室。
Datadog:全科医生,不懂 LLM
也考虑过 Datadog。通用 tracing 很强,但它不懂 LLM——不会算 token cost,没有 prompt 管理,没有 eval。就像全科医生和专科医生的区别。
社区怎么评价这些工具?
Reddit 上的讨论很有参考价值。在 r/LangChain 的一个帖子里,LangFuse 被称为 "most serious self hosted open source platform"。r/AI_Agents 上有人一针见血:
"Observability tells you what happened, not how to fix it."
也有人分享了自己的实践——不是靠 dashboard 告警,而是固定 8 个 canary 场景,每次 prompt 变更后重跑,"caught more drift this way than langfuse alerts ever did"。还有人指出:
"Getting the data OUT to do cross-session analysis is a pain."
数据导出确实是个短板。
三个平台横向对比
| 维度 | LangFuse | Braintrust | Datadog |
|---|---|---|---|
| Tracing | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| Eval | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐ |
| Prompt Management | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ❌ |
| 开源 | ✅ MIT | ❌ | ❌ |
| Self-hosted | ✅ | ❌ | ❌ |
| 定价 | 免费(self-hosted) | 免费层慷慨 | 贵 |
| LLM 专项 | ✅ | ✅ | ❌ |
为什么最终选了 LangFuse?
选了 LangFuse Self-hosted。 理由很简单:
- 一个平台覆盖我们 80% 的需求——Tracing、Prompt Management、Eval 都有
- 开源 MIT,Self-hosted 免费,数据完全在 VPC 内
- 数据可移植性好——CSV/JSON/API 导出,Cloud 到 Self-hosted 有官方迁移 cookbook
- 不想搞三个平台,一个够用就行
Braintrust 的 eval 体验更好,但为了一块短板加一个平台不值得。Datadog 懂基础设施但不懂 LLM,不是这个阶段的选择。
调研后形成的四个观点是什么?
调研完了,几个观点:
1. Observability 告诉你发生了什么,不告诉你怎么修
Reddit 上的原话。Tracing 是基础设施,不是终点。大部分团队上了 tracing 之后看着 dashboard 觉得"好有信息量",然后什么也没做。数据本身不是洞察,分析才是。
2. 大部分团队什么都不用就上线了
这不是段子,是事实。很多 AI 产品没有 eval、没有 tracing、没有 golden set,照样跑着。我们不评判对错,但如果你在做一个需要质量保证的系统(比如评分),那就不能这么玩。
3. 一个平台够用,别搞三个
LangFuse 做 tracing + prompt 管理,Braintrust 做 eval,Datadog 做通用监控——听起来很美,但维护成本爆炸。我们建议:选一个覆盖最多需求的,接受它的短板。
4. 没有银弹,这个领域还在早期
LLM eval 这个领域变化很快。2025 年的工具到 2026 年可能就被替代了。LangFuse 自己刚被 ClickHouse 收购,长期路线图会怎么变还不确定。所以不要过度投入任何单一平台,保持数据可迁移。
如何从零搭建 LLM Eval 体系?
如果你也在做一个 LLM 产品,想从"能跑"到"靠谱",我们的建议很简单:
MVP 最低要求是什么?
- 10 条 golden set — 手工标注的正确答案,覆盖典型和边界场景
- Manual check — 改了 prompt 后,跑一遍 golden set,手动看结果
- 就这些。不需要平台,不需要代码,一个下午搞定。
三个 Stage 怎么走?
Stage 1:Tracing(1-2 天)
- 接入 LangFuse,每次 LLM 调用的 input/output/cost/latency 全记录
- 你会第一次"看见"你的系统在干什么
Stage 2:Prompt Management(2-3 天)
- 把 prompt 从代码里搬到 LangFuse 管理
- 改 prompt 不用改代码重新部署,秒级生效
Stage 3:Eval Dataset(3-5 天)
- 把 golden set 建到 LangFuse,配一个 LLM-as-Judge
- 改 prompt 前自动跑 benchmark,防止 regression
三个 stage 加起来一周。之后就是持续的迭代——Observability → Evaluation → Prompt Management → 循环。
总结:这次调研教会了我们什么?

Eval 不是一次性项目,是持续工程。我们还在 Stage 1 的路上,但至少现在知道方向了。
如果你也在走类似的路,希望这些经验对你有帮助。没有什么高深的道理,就是一个工程师团队面对真实问题时的思考过程。
FAQ
LLM Eval 是什么?为什么 AI 产品需要它?
LLM Eval 是对大语言模型输出质量进行系统性评估的工程实践。没有 eval,改了 prompt 或模型后你无法量化输出是变好还是变差——对于评分、医疗、法律等对质量敏感的场景,这是不可接受的。
LangFuse 和 Braintrust 哪个更适合做 LLM Eval?
LangFuse 是更全面的选择,覆盖 Tracing + Prompt Management + Eval,适合需要一个平台搞定一切的团队;Braintrust 的 Eval 体验更好,但缺少生产监控和 self-hosted 选项。如果只能选一个,选覆盖面最广的。
搭建 LLM Eval 体系最少需要什么?
10 条手工标注的 golden set + 改 prompt 后手动跑一遍检查,不需要任何平台,一个下午搞定。这是真正的 MVP,之后再考虑接入 LangFuse 等工具自动化。
什么是 Golden Set?怎么构建?
Golden Set 是一组手工标注的"标准答案",覆盖典型场景和边界 case。构建方法:从生产数据中挑 10-20 条有代表性的输入,人工标注期望输出,每次 prompt 变更后用它验证结果。
LLM-as-Judge 是什么意思?
LLM-as-Judge 是用一个 LLM 来评估另一个 LLM 输出质量的技术。你可以定义评分维度(如准确性、相关性、语气),让 Judge 模型对输出打分,实现自动化评估,替代人工抽检。
本文观点来自我们的真实调研过程。以下是主要参考来源:
References
- LangFuse — Open Source LLM Engineering Platform (GitHub 24k+ stars, MIT License)
- Braintrust — AI Evaluation Platform ($80M Series B, eval-first)
- Thoughts on Langfuse? — r/LocalLLaMA
- Full traces in Langfuse, still debugging by guesswork — r/LLMDevs
- Langfuse vs Braintrust vs Maxim: What actually works? — r/AIQuality
- How does Langfuse differ from Braintrust for evals? — r/LLMDevs
- LangSmith vs Langfuse — r/LangChain
- Is Langfuse self-hosted really equal to the managed product? — r/LangChain
- Langfuse review and other options — r/AI_Agents
- LLM Observability in 2026: Tools & Best Practices — TokenMix
- Langfuse alternatives: Top 5 competitors compared (2026) — Braintrust
- ClickHouse acquires Langfuse (Jan 2026)
- Mastra AI Observability
- Arize Phoenix — OpenTelemetry-native AI Observability
Want to work together?
I'm always happy to connect — whether it's a project, a question, or just to say hi.
Get in Touch →