近来所记
Model Ergonomics:Harness 如何影响 Agent 能力
同一个模型换一个 harness,表现可能完全不同。本文从 Model ergonomics 出发,讨论模型与工具、上下文、反馈和执行环境之间的匹配关系,并以 Grok 运行在 Codex harness 上的实践分析 generalized harness 与 specialized harness 的边界。
让 Gate 看见过程:LLM Agent 开发中的观察、契约与诊断
LLM agent 的开发循环不缺 PASS 或 FAIL,缺的是能指导下一轮修改的过程证据。本文讨论如何在关键 gate 中加入结构化 observation,同时让明确契约继续决定成败。
Bitter Lesson 之后:Agent 的手工设计会消失吗?
当智能体开始从执行轨迹中学习,意图分类、任务阶段、规划器和状态机可能逐渐被模型吸收,但接口、安全边界、评估与运行环境不会因此消失。
系列大语言模型智能体的运行时架构1/2架构篇
从工具调用到事件驱动:大语言模型智能体的运行时架构
大语言模型智能体不应只被理解为一次次工具调用的串联;当任务变长、环境变复杂,运行时需要转向事件驱动的架构来承载状态、并发、观察和恢复。