Eval体系与生命周期

Eval 体系
给agnet出卷子,根据结果数据打分,量化表现,对更改的参数得到反馈
lifecycle和telemetry
Lifecycle Callbacks是真实跑的时候的"行车记录仪"——每一步的输入输出、耗时、token量全录下来。
由Vercel SDK标准化,它提供六个时间点让你插自己的代码:Agent开始时、每轮LLM调用前、工具执行前、工具执行后、每轮结束后、全部结束后。每个时间点SDK把当前状态传给你——这一步输入了什么、输出了什么、用了多少token、花了多少毫秒。
指标是Agent性能是硬数据:
- 每轮耗了多少token(成本)
- 每轮花了几秒(延迟)
- 工具调用成功率(可靠性)
- 平均几轮完成任务(效率)
- 什么时候Loop停了、为什么停(行为分析)
Lifecycle Callbacks是自动化的——每次线上跑都自动采集,积累多了就能看出趋势:这个Agent越来越快了还是越来越慢了?最近token消耗翻倍了,是哪个步骤变长了?
telemetry就是Lifecycle Callbacks采集到的数据的统称。 Telemetry是这些数据的用途——把采集到的数据汇总、分析、看趋势。就像汽车的仪表盘:速度表、油量表、里程表的数据来源是各个传感器(Lifecycle Callbacks的功能),但仪表盘本身(Telemetry)让你一眼看到"现在油不够了""这次跑得比上次快"。
测试和日志
测试的作用是锁住,锁住已验证的情况,在前后改动中发现问题存在 与代码是共生关系,改代码→跑测试→运行→改测试→存档 日志跟测试互补。测试告诉你"对不对",日志告诉你"过程发生了什么 日志发现问题在哪

