LLM

大多数团队从未跨过凭感觉做 LLM 评估的阶段。这是我们在每一个生产环境智能体上运行的评估框架——黄金集、三层评分,以及何时该停止增加覆盖。

LLM 评估仪表盘——黄金集与评分层

我们接触的每个团队都在跑某种形式的 LLM 评估。他们中的大多数都跑错了。问题通常不在模型——而在衡量方式。这就是我们在每一个生产环境智能体上运行的 LLM 评估手册,剔除了那些只在大会演讲里好听的部分。

从黄金集开始,而不是从指标开始

任何 LLM 评估的第一件产物,都是 40 个人工精选、能代表你流量形态的样例。不是 400 个,不是 4000 个——就是 40 个。小到人真的读得完,又大到足以捕捉品类级别的回归。每当生产环境冒出一个 bug,那个失败样例就会被加进黄金集。

LLM 黄金集——人工精选的评估样例
黄金集——40 个样例,每个配一段点评,由某个人负责。

四十个例子,一个下午就读得完。这个限制本身就是目的:没人读的评测集不再描述产品,只会变成看板上的一个数字。

工作室作品示例
工作室作品示例
工作室作品示例

评测框架归谁

框架属于交付智能体的工程师,而不是一个独立的质量团队。下面这段片子就是这份工作所在的工作室。

工作室短片。

面向 LLM 智能体的三层评分模型

我们在三个层面为每一条智能体响应评分。硬性约束——它有没有调用正确的工具、输出有没有通过 schema 校验。正确性——对可验证的任务而言,答案是否真的对。判断——第二个模型是否认为这条响应可用。这些层面不加权:任一层失败即为失败。

LLM 输出的硬性约束校验器
LLM 判断层评估仪表盘

何时停止评估,转而倾听生产环境

评估并非越多越好。一旦智能体在黄金集上的通过率超过 95%,下一次回归几乎必然来自你没预料到的品类,而不是准确率的边际下滑。那就是停止增加覆盖、转而从生产环境接入遥测并反馈回来的时机。

01更多工作室案例

同一支团队,不同的难题。 邻近行业的近期案例——每个都由对结果负责的资深工程师亲自交付。

需求

按类型的作品集按年份

各类型项目逐年增长

MVP重构AI运维合计

MVP、重构、AI 与运维——累计

优势概览

工作室在关键维度上的画像

速度、质量、透明、工程

项目阶段随时间

调研、设计与研发相互交叠

并行推进——不是瀑布