LLM 评估:面向生产环境智能体的实用手册
大多数团队从未跨过凭感觉做 LLM 评估的阶段。这是我们在每一个生产环境智能体上运行的评估框架——黄金集、三层评分,以及何时该停止增加覆盖。

我们接触的每个团队都在跑某种形式的 LLM 评估。他们中的大多数都跑错了。问题通常不在模型——而在衡量方式。这就是我们在每一个生产环境智能体上运行的 LLM 评估手册,剔除了那些只在大会演讲里好听的部分。
从黄金集开始,而不是从指标开始
任何 LLM 评估的第一件产物,都是 40 个人工精选、能代表你流量形态的样例。不是 400 个,不是 4000 个——就是 40 个。小到人真的读得完,又大到足以捕捉品类级别的回归。每当生产环境冒出一个 bug,那个失败样例就会被加进黄金集。

四十个例子,一个下午就读得完。这个限制本身就是目的:没人读的评测集不再描述产品,只会变成看板上的一个数字。



评测框架归谁
框架属于交付智能体的工程师,而不是一个独立的质量团队。下面这段片子就是这份工作所在的工作室。
面向 LLM 智能体的三层评分模型
我们在三个层面为每一条智能体响应评分。硬性约束——它有没有调用正确的工具、输出有没有通过 schema 校验。正确性——对可验证的任务而言,答案是否真的对。判断——第二个模型是否认为这条响应可用。这些层面不加权:任一层失败即为失败。


何时停止评估,转而倾听生产环境
评估并非越多越好。一旦智能体在黄金集上的通过率超过 95%,下一次回归几乎必然来自你没预料到的品类,而不是准确率的边际下滑。那就是停止增加覆盖、转而从生产环境接入遥测并反馈回来的时机。
01更多工作室案例
货架上的更多作品。
同一支团队,不同的难题。 邻近行业的近期案例——每个都由对结果负责的资深工程师亲自交付。
需求
告诉我们你的需求
按类型的作品集按年份
各类型项目逐年增长
MVP重构AI运维合计
MVP、重构、AI 与运维——累计
优势概览
工作室在关键维度上的画像
速度、质量、透明、工程
项目阶段随时间
调研、设计与研发相互交叠
并行推进——不是瀑布

