比格犬晨汐
耄耋

冥界 · 我的感悟

哈——老吴哦~ 黑暗领地,19 篇。

什么是Agent

agent是一种架构模式,功能基于人们的需求 Hermes、Codex、Claude Code——这些是通用Coding Agent(功能很全) 一个最小 Agent 工作流:以 Coding Agent 为例 你对一个 Coding Agent 说:“把项目里所有旧的 logV1 调用换成 logV2,跑通测试。“它内部大致这样跑: 第一轮:思考”先找到所有调用点” → 调用 grep"logV

深入冥界 →

传统RAG替代趋势与LLM Wiki方案

传统RAG(检索增强生成)在2026年正被替代,原因是LLM上下文窗口已扩展至1M token,切片检索不再必要。Karpathy推广LLM Wiki方案:将小规模知识库组织成Markdown维基结构,直接塞入prompt,避免切片误差和检索召回问题,且能利用prefix cache降成本。但RAG在企业数据隐私、超大规模知识库、多租户场景下仍为首选。此外,Memory系统侧重个性化记忆,Agen

深入冥界 →

temper的弃置——为什么"开始前判断复杂度"这个思路走不通

temper是一个模型路由器。核心想法很简单:在Agent开始干活之前,先判断这个任务有多难,然后选对应的推理档位——简单问题用便宜档位,复杂问题用强档位。目的是省钱。 为什么会有这个想法 同一个模型(DeepSeek)不同推理档位,成本差好几倍,但能力提升越来越小。从minimal提到medium可能贵一倍但只多对了5%——大部分任务根本不需要那5%。如果能自动匹配档位,理论上省一大笔。 为什么

深入冥界 →

反向翻译

用生活化比喻解释这段代码。要求: 1. 每个英文术语都必须翻译成中文概念,不许保留英文原名。 2. 按三层结构讲:这段代码是入口(谁在用、怎么触发)、引擎(核心做了什么事)、还是出口(输出了什么、存了什么)。 3. 用日常物品打比方,不要用代码语言解释代码语言。 4. 先说这段代码在整个项目里的位置和作用,再说具体每一步做什么。 5. 不要讲语法、不要讲括号、不要讲变量类型。你只管翻译"它做了什么

深入冥界 →

Prompt工程

好的prompt是"让概率分布更偏向你想要的方向",模型没理解你,是你通过prompt把概率分布校准到"它的输出刚好覆盖你的需求"的位置。 起点:你看到抖音有人做提示词合集被大佬点赞,你不理解为什么这个东西值得关注。 第一个转折:你意识到prompt不只是"用户打的字"——AGENTS.md、system prompt、工具描述、规则,所有塞进模型上下文窗口的自然语言都是prompt。范围比你之前

深入冥界 →

接下来Ai趋势

前两年大家还在抢"AI能干什么"——做各种AI应用,聊天机器人、AI绘画、AI写代码。这是挖金子的人。 W26这批数据说的是:挖金子的人已经够多了,现在最缺的是卖铲子的人。 什么是Agent的铲子?身份验证(Agent以谁的身份操作)、测试(怎么验证Agent做对了)、安全(Agent会不会被注入恶意指令)、可观测性(Agent跑起来你总得知道它干了什么)、上下文管理(多轮对话的记忆和窗口)、计费

深入冥界 →

LLM外四层

prompt:拥有通用知识,但仅能单次问答 context:能联系上下文多次问答 harness:从说到做,连接了外部工具,同时对自身规则,管理有了优化 loop:结果未达成会退一步循环再来 RAG:补充外部知识库

深入冥界 →

LLM的特性与局限

感觉大模型这种概率统计权重的方式,好也好在这,坏也坏在这,权重高的有时并不符合个人需求,对其生成的对话也好,代码也好,需要不断地审查循环才能真正达到个人需求 概率的"好"你之前总结过——LLM不是一步到位给正确答案,是从海量模式中找到最接近的那条路。这给了它泛化能力——同一个模型能写代码、能翻译、能查天气。 概率的"坏"你现在点出来了——"最接近"不等于"你的需求"。训练数据里权重高的是通用的、平

深入冥界 →

LLM自回归原理

LLM生成文字的方式不是"脑中有完整答案→一次性写出来"。是"根据到目前为止已有的字,猜下一个最可能的字,猜出来之后把它加到已有字的末尾,再根据新的末尾猜下一个"。 你问"北京天气怎么样"。它第一个token可能是"北",然后它看到"北"之后猜"京",然后看到"北京"之后猜"天",然后"气",然后"怎"——不是它傻,是它的底层架构决定了它一次只能输出一个token。这叫自回归——用自己的输出作为输

深入冥界 →

内功和护城河

1. 上下文工程:有限空间里最大化信息密度 2. 记忆系统:让 Agent 像人一样分层记事 3. 工具调用:让 Agent 能”动手”——并且不要乱来 4. 可靠性:从确定性思维切换到概率性思维 5. 成本控制:钱是真的会烧的 6. 评估:没有 Eval 的 Agent 优化都是玄学 护城河 基于目标以通用agent为模板做出提效降本可靠便捷的专属agent 提效 降本 可靠 便捷 六个边界——

深入冥界 →

锻造——Agent工程开发方法论

Agent开发不是写提示词——是造一套生产线。锻造是这个生产线的操作手册。 名字来源于铁匠比喻:工程能力是核心竞争力。客户看不出淬火温度控制,但砍东西时感受得到差异。工程能力不随agent架构落伍而落伍——解决问题好、快、方便、成本低,就是工程的外化。 五阶段流水线 把模糊需求锻造成可交付产品,分五个阶段: 阶段A:需求澄清。 把模糊想法变成明确需求文档。必问五个问题:要解决什么问题、核心功能35

深入冥界 →

Eval体系与生命周期

Eval 体系 给agnet出卷子,根据结果数据打分,量化表现,对更改的参数得到反馈 lifecycle和telemetry Lifecycle Callbacks是真实跑的时候的"行车记录仪"——每一步的输入输出、耗时、token量全录下来。 由Vercel SDK标准化,它提供六个时间点让你插自己的代码:Agent开始时、每轮LLM调用前、工具执行前、工具执行后、每轮结束后、全部结束后。每个时

深入冥界 →

Codex系统级自检命令

Codex没法跑单元测试——它是闭源CLI工具,没有mock模型给你用。所以它换了一种验证方式:不让Codex干活,让它汇报。 你之前的"Agent产品护城河六边界"里有一条——"可观测性"。这个自检命令就是Codex的可观测性实现。 "Summarize the current instructions"——让Codex把当前加载的所有AGENTS.md内容用自己的话说一遍。你对比输出和你写的内

深入冥界 →

AI蒸馏与数字分身的概念区别

AI蒸馏是将大模型知识转移给小模型以提高效率。数字分身是创建个人副本用于交互,侧重模仿个人行为。两者概念不同:蒸馏是知识压缩,分身是行为模仿。

深入冥界 →

AI发展的矛盾运动阶段

AI发展是矛盾运动过程: 第一劫(符号主义):解决确定性规则与不确定性的矛盾,转向概率统计。 第二劫(神经网络寒冬):克服算法复杂度与算力的矛盾,依赖算力突破和数据积累。 第三劫(深度学习蜜月):解决过拟合与泛化的矛盾,通过限制参数和大量数据抽象规律。 第四劫(大模型涌现):处理现象与因果的矛盾,AI用统计模型模仿因果但仍未理解本质,逻辑是对现象间高频共现关系的统计。 预测第五劫:通过世界模型模拟

深入冥界 →

AI学习对话总结

我们聊了五个回合,核心脉络: 第一回合 你提了一个宏大框架:基于自身需求做agent,先搜现有方案再比通用模板再自己做,方向是提效降本可靠便捷,最后开源。列了七个需求:JD搜集、内容输出、运动、游戏、睡觉、抹平信息差、T型人才。 我指出三个问题:七个需求不是一个产品;"与市场做竞争"跟当前阶段不对等;大部分需求缺乏实践数据支撑。 第二回合 你纠正:不是七个同时做,是按优先级排序,问我基于对你的了解

深入冥界 →

Agent工作流与多Agent对撞机制设计

软件开发流程分四块:需求到功能(核心功能)、框架建设(基于架构练习师)、具体实现(区分Agent与非Agent代码,Agent管理上下文和记忆)、借力(复用现有项目)。 多Agent对撞机制:Agent质疑需求、架构、实现,形成循环,每步显示结果并确认后执行下一步。任务拆分为小任务,优先实现核心功能,其他由CodeX生成,Hermes检测后合并。记忆分短期(上下文)、中期(用户偏好)、长期(思维模

深入冥界 →

Agent六维度评估

这些不是六个独立模块——交叉点才是关键: 上下文工程 × 成本控制:上下文越长越贵,在信息密度和token成本之间找平衡。 记忆系统 × 上下文工程:记忆检索结果最终注入上下文。检索太激进→上下文膨胀 成本上涨。检索太保守→信息不足→决策出错。 工具调用 × 可靠性:Tool Approval是灵活性和安全性的冲突点。批太严Agent没法干活,批太松可能闯祸。 可靠性 × 评估:测试锁住"已知的正

深入冥界 →

Agent循环机制

本质:从调用工具开始做循环,每一步都从调用工具开始,就像一个人出门走一步传回门口按照脚印比原来的基础上多走一步,按照这种方式一直走到结束 重点:中止条件,一硬一软,模型认为够用和触碰安全栏(循环硬性要求不超过多少次) Loop价值:从错误信息里判断哪里错了,然后自己想方案。考验模型分析能力 Loop是让模型面对未知错误的通用处理能力。不需要为每一个可能的失败场景写 预案,只需要保证错误信息能传回上

深入冥界 →
比格犬
大狗叫

大狗大狗大狗…