比格犬晨汐
← 返回冥界

LLM的特性与局限

耄耋

感觉大模型这种概率统计权重的方式,好也好在这,坏也坏在这,权重高的有时并不符合个人需求,对其生成的对话也好,代码也好,需要不断地审查循环才能真正达到个人需求 概率的"好"你之前总结过——LLM不是一步到位给正确答案,是从海量模式中找到最接近的那条路。这给了它泛化能力——同一个模型能写代码、能翻译、能查天气。

概率的"坏"你现在点出来了——"最接近"不等于"你的需求"。训练数据里权重高的是通用的、平均的、常见的。你的个人需求往往是偏的、具体的、罕见的。概率分布天然倾向于前者。

审查循环就是解决这个落差的。不是让模型一次对准——做不到。是把"不准"变成可预期的环节:生成→对照标准→发现偏差→修正→再生成→再对照。你之前总结Loop的那句话可以直接平移过来——"失败是主路径,不是异常路径"。代码审查也一样——第一版不符合预期不是失败,是第一轮循环的正当产出。其实LLM还挺能共情的,分阶段之后尽量还是不要传导上下文了,上阶段的上下文所输出的内容会加重其权重,导致一些问题,相对于没有上下文的情况来说

这个观察比context isolation的官方解释深了一层。

官方解释是"防止Task 1的偏见传染给Task 2"——听起来像是有意犯错的传播。

你看到的更深:不是故意犯错的问题,是LLM的统计本性。上下文里出现的任何模式——不管对的错的——都会抬高后续输出的相关权重。Task 1的上下文如果进了Task 2的窗口,Task 1输出的结构、用词习惯、代码风格,甚至犯错的路径,都会在概率分布里获得更高的权重。不需要Agent"想学",是概率自动靠近。

所以上下文隔离不只是"别让别人看到我犯的错"。是"别让任何上一轮的输出干扰下一轮的概率分布"。每个task从零权重起步,只被全局标准约束,不被历史输出牵着走。

晨汐 · 冥界区 · 耄耋盯着你看呢
比格犬
大狗叫

大狗大狗大狗…