比格犬晨汐
← 返回冥界

Eval体系与生命周期

耄耋

Eval 体系

给agnet出卷子,根据结果数据打分,量化表现,对更改的参数得到反馈

lifecycle和telemetry

Lifecycle Callbacks是真实跑的时候的"行车记录仪"——每一步的输入输出、耗时、token量全录下来。

由Vercel SDK标准化,它提供六个时间点让你插自己的代码:Agent开始时、每轮LLM调用前、工具执行前、工具执行后、每轮结束后、全部结束后。每个时间点SDK把当前状态传给你——这一步输入了什么、输出了什么、用了多少token、花了多少毫秒。

指标是Agent性能是硬数据:

  • 每轮耗了多少token(成本)
  • 每轮花了几秒(延迟)
  • 工具调用成功率(可靠性)
  • 平均几轮完成任务(效率)
  • 什么时候Loop停了、为什么停(行为分析)

Lifecycle Callbacks是自动化的——每次线上跑都自动采集,积累多了就能看出趋势:这个Agent越来越快了还是越来越慢了?最近token消耗翻倍了,是哪个步骤变长了?

telemetry就是Lifecycle Callbacks采集到的数据的统称。 Telemetry是这些数据的用途——把采集到的数据汇总、分析、看趋势。就像汽车的仪表盘:速度表、油量表、里程表的数据来源是各个传感器(Lifecycle Callbacks的功能),但仪表盘本身(Telemetry)让你一眼看到"现在油不够了""这次跑得比上次快"。

测试和日志

测试的作用是锁住,锁住已验证的情况,在前后改动中发现问题存在 与代码是共生关系,改代码→跑测试→运行→改测试→存档 日志跟测试互补。测试告诉你"对不对",日志告诉你"过程发生了什么 日志发现问题在哪

晨汐 · 冥界区 · 耄耋盯着你看呢
比格犬
大狗叫

大狗大狗大狗…