外脑:按记忆组织的 agent 工作区 外脑:按记忆组织的 agent 工作区 外脑:按记忆组织的 agent 工作区
每次对话都从失忆开始
任何一个 agent,每次新会话开始时都是失忆的。它不知道上周你为什么否掉那个方案,不知道你习惯先算风险再看收益,也不知道三个月前你刚踩过同一个坑。提示词里可以补几句,但那点空间装不下一个人。
这个缺陷和人的遗忘几乎同构,而人的解法从来都是外置:记在纸上,存进文件里。Clark 和 Chalmers 在 1998 年的《The Extended Mind》里给这个行为留了哲学位置:阿尔茨海默病患者 Otto 随身带一个笔记本,当笔记本足够稳定、可靠、随时可查,里面记的东西就应该被当作 Otto 的信念本身,而不是”外部资料”。他们把这叫对等原则(parity principle):外部资源只要在认知过程里干着和大脑一样的活,就没有理由被皮肤和颅骨的边界挡在心智之外。
我把这件事的做法叫外脑:一个按记忆结构组织的 workspace,人和 agent 都在里面读写。这个词的前身是超人类主义语境里的 exocortex(external cortex 的缩写),它在科幻和脑机接口讨论里转了很多年,始终停在隐喻。外脑补的是执行层。PARA 和 Zettelkasten 这类笔记方法缺的从来不是结构,是执行者;agent 住进这个 workspace,替你记录、检索、整理,也在里面接活。
按记忆类型组织的目录
外脑的顶层不按项目分,按记忆类型分。学理依据是 CoALA(Cognitive Architectures for Language Agents)的四分类:working memory(当前上下文)、episodic memory(经历)、semantic memory(事实与知识)、procedural memory(技能)。这套分类在 agent 研究里已经是底座级别的共识,MemGPT 把窗口内的 main context 和窗口外的 external context 分开管理,本质上就是 working memory 和其余记忆的分界。
落到目录上大致是这样:
brain/
episodic/ # 经历:发生过什么
journal/ # 决策记录:当时的选项、理由、预期
sessions/ # 与 agent 的长期工作记录
semantic/ # 事实:我知道什么
notes/ # 沉淀后的结论,一文件一事
domains/ # 领域知识
procedural/ # 技能:我怎么做事
skills/ # SKILL.md 形式的能力包
conventions/ # 约定文件(AGENTS.md / CLAUDE.md)
registry/ # 注册表:哪些 workspace 接入了外脑
路径在这里既是存放位置,也是检索接口。PARA 的组织原则是按可执行性而非主题分类,同一个思路翻译到这里:按”这段记忆属于哪类认知活动”来分目录。agent 要回忆”我当时为什么这么决定”,它去 episodic/journal,用不着对全库做语义搜索;要查”我们做事的规矩”,它去 procedural。路径就是先验。
目录树有个天生的短处:记忆不是树状的,是网状的。一条决策常常同时连着当时的情绪、当时的预算和一个半年前的教训,但它在树上只能挂一个位置。Zettelkasten 用唯一编号加链接解决这个问题,目录树可以用同一招:笔记里放指向其他文件的相对链接,文件夹只承担大类的划分,联想交给链接。这样检索就有两条路,顺着目录走的是”我知道它在哪一类”,顺着链接走的是”我记得它和什么有关”。
外置还有一层被迫的理由:往上下文里塞是走不通的。Chroma 2025 年 7 月的 context rot 报告测了 18 个模型,输入 token 越长性能越低,远没到窗口上限就开始掉,GPT-4.1 在一个重复词任务上从百级 token 的约 99% 掉到十万级 token 的约 70%。Anthropic 的 context engineering 文章给的三种手段里,structured note-taking 就是让 agent 把状态写进窗口外的文件,需要时再读回来。外脑没有发明新东西,它把这一招做到了底:整个 workspace 都是窗口外的记忆,上下文里只留当前那一层。
skill:让任何 agent 能在里面生活
只有目录不叫外脑。agent 得有在里面生活的技能,这一层用 SKILL.md 格式实现,也就是 Anthropic 2025 年开放的 Agent Skills 规范:一个 skill 是一个带 SKILL.md 的目录,frontmatter 必填 name 和 description,description 决定模型什么时候触发它,正文控制在五千词内,更细的材料挂成文件按需读取。加载是三层渐进披露(progressive disclosure):启动时只载入元数据,几十个 token;触发时读正文;用到时读文件。关键是它不绑定任何 harness,只要 agent 实现了这套加载规范,同一批 skill 谁都能用。
外脑需要哪些 skill?我按认知活动分了六类:
- 记录类。把正在发生的事写进 episodic:日志、会话记录、决策记录。这是情景记忆的入口。
- 回忆类。按时间线或按语义把 episodic 翻出来,对应人的”想起来”,区别是可查询。
- 整理类。合并重复、标记过期、纠正错误。Mem0 的更新流水线对每条新信息判断 ADD、UPDATE、DELETE 还是 NOOP,是个可以抄的先例。记忆库不整理就会烂掉。
- 反思类。定期把 episodic 提炼成 semantic。Generative Agents 的 reflection 机制值得抄:新记忆的重要性分累加超过阈值才触发一次提炼。提炼要攒够材料才做。
- 决策类。把 premortem 清单、base rate 查询固化成流程,下一节展开。
- 注册类。把新的 workspace 接进外脑,机制再下一节。
和系统提示词相比,skill 的成本结构完全不同:系统提示词常驻上下文,每次调用全额计费;skill 平时只是几行 description,干活时才展开。外脑里的知识大部分应该住在 skill 和文件里,不要住在提示词里。
这六类里最容易被低估的是整理类。记和查是正反馈,越记越好查;整理没有即时回报,拖一周,语义分区的重复条目就开始互相污染。把它做成 skill 而不是”想起来再做”,是外脑和普通笔记库的分界。另外,skill 的两个入口要分清:可以由人写,也可以由 agent 沉淀。agent 把某次成功的操作流程写成新的 SKILL.md 放回 procedural,程序性记忆就自己长了。
收益:经历的清醒度和决策效率
前面两节都是机制,这个做法到底改变什么?
第一件是过往经历的清醒度。“去年这个时候我在想什么”,人对自己的生物记忆答不出来,对文件系统答得出来:journal 里有记录,带时间戳。人的回忆靠重构,每重构一次就改写一次;文件不会,它只在你写错的那一刻错一次,之后一直诚实。回到 Otto 和 Inga 的对比:外脑是把 Otto 的笔记本升级成一个有人帮你整理、还能替你执行动作的版本。
第二件是决策效率。这里得诚实:外脑不替你做决策,它改变的是决策时证据到位的速度。
- 决策日志对抗事后诸葛偏差(hindsight bias)。做完决策回头看,人会不由自主觉得”我早就知道会这样”,于是当时的真实理由丢了,判断校准也无从谈起。决策日志的用处是把”当时怎么想的”钉住,Farnam Street 把它定位成给未来的自己留下当时的判断样本。
- episodic 记忆充当自己的 base rate。“上次遇到类似情况是什么结果”,没有记录的人只能靠感觉,有 journal 的人做一次查询。Kahneman 说的 outside view 在这里变成可执行动作:Flyvbjerg 统计的一万六千多个项目里,同时做到按时、按预算、达预期收益的只有约 0.5%。人对自己项目的直觉几乎必然比这乐观,自己的历史记录是唯一不迁就你的参考类别。
- premortem 固化成 skill。Gary Klein 2007 年在 HBR 上介绍的做法:宣布”项目已经失败”,让每个人独立写下失败原因。实验依据是 prospective hindsight 让人识别未来失败原因的能力提高约 30%,出自 Mitchell、Russo 和 Pennington 1989 年的研究,经 Klein 转述。写成 skill 的意义是把”这次要不要走一遍 premortem”这个每次都会被省掉的决策,变成流程里自动执行的一步。
拼起来是一次立项前的动作。决策类 skill 被唤起后做三件事:从 journal 翻出过去几个同类项目的记录当参考类别,按 premortem 清单逼我写下失败理由,再把这次的预期结果和信心水平记进 journal。三个月后复盘,对的是当年的记录,不是记忆。
这些做法没有 RCT 级证据,30% 来自单一实验室研究。外脑给不出证明,它做的是把已知的偏差对策变成默认动作。
注册:任意 workspace 的拔插
外脑的价值随接入的 workspace 数量增长。项目仓库、笔记库、生活目录各有各的上下文,注册机制要解决的是:怎么让外脑知道它们,让任何 agent 在任何地方都带着同一份关于这个人的 context。
这件事不用发明新协议,三层都有现成的行业锚点。
- 约定文件层。AGENTS.md 已经是跨厂商的开放格式,OpenAI Codex 和 Grok CLI 都认它;CLAUDE.md 有企业、项目、用户三级加载,加子目录懒加载,嵌套时就近优先。这本身就是现成的发现算法,注册的第一步只是检查目标 workspace 里有没有约定文件。
- 能力层。注册的动作是把 workspace 的说明写成一份符合规范的 SKILL.md:name 和 description 写清这里是什么、能查什么、有什么规矩。agent 平时只看见 description,需要时才加载正文,和 skill 的渐进披露是同一个思路。
- 协议层。MCP 的 host、client、server 架构,加上 2025 年 9 月预览的官方 Registry,已经把插件式接入外部 context 做成了行业标准:接一个新数据源等于挂一个 server,拔掉等于删配置。workspace 可以包成一个 MCP server,或者一个注册条目。
三层合起来解决的是同一个问题。单个 AGENTS.md 只懂单个项目,注册要给的是另一件事:无论 agent 在哪个 workspace 干活,它都知道你是谁、你怎么做事、你的历史里有什么可查。项目级的上下文由各 workspace 自己的约定文件负责,人的上下文由外脑负责,两层在注册时接上。冲突也在注册时处理:几个 workspace 都有同名 skill 时,注册清单里的名字加命名空间前缀,避免 description 撞车导致触发错乱。
一份注册清单大致长这样:
# brain/registry/research-notebook.yaml
name: research-notebook
path: ~/work/research-notebook
description: 研究笔记仓库,Markdown 为主,按课题分目录
conventions:
- AGENTS.md
skills:
- lit-review # 注册后,该 workspace 专属的技能也可被外脑调用
memory:
episodic: episodic/sessions/research-notebook/
semantic: semantic/domains/research/
注册不要求 workspace 做任何改造,最小要求只是一个清单文件,没有可以当场生成。格式是 Markdown 和 YAML,落在本地文件系统,不落在私有数据库。Obsidian 和 Logseq 用了很多年证明”本地文件加开放格式”站得住。记忆类产品走的是另一条路:ChatGPT memory 有接口但结构不透明;Rewind 录下你看过的一切,然后连公司一起被收购,服务随之下线。PKM 工具结构可读但没有 agent 接口,记忆产品有 agent 接口但结构不可读。外脑想占的是中间缺的那层:人能读的目录,agent 能执行的 skill,加一个开放注册。
三个扩展方向
Computer Use:给外脑接上运动皮层
Computer Use 让模型直接操作图形界面:截屏、决策、执行键鼠动作。Anthropic 2024 年 10 月放出 API 时,OSWorld 基准(真实操作系统上的 369 个任务,人类成功率 72.36%)上它的成绩是 14.9%;到 2025 年 9 月的 Claude Sonnet 4.5,OSWorld-Verified 做到 61.4%。一年翻了两番,离人类还差最后一截。官方文档同时写明:仍是 beta,建议在最小权限的沙箱里跑,存在提示注入和误操作风险。
和外脑结合,方向不是”AI 替我点鼠标”,而是闭环:semantic 记忆里存着”这类操作上次是怎么做的、哪里容易出错”,agent 带着记忆去操作,操作日志再回写 episodic。GUI 操作日志于是成为情景记忆的可检索入口。
多 agent:外脑当大脑,其他 agent 当手脚
Anthropic 的多 agent 研究系统给了 orchestrator-worker 模式的参考实现:lead agent 拆解任务,子 agent 各持独立上下文并行干活,只回传浓缩结果。内部评测比单 agent 高 90.2%,代价是 token 消耗约为普通聊天的 15 倍。15 倍里相当一部分花在子 agent 互相不通气的重复劳动上,外脑恰好是共享记忆层:子 agent 不继承全部历史,按需读分区,干完把结果写回去。跨厂商的 agent 互操作有 A2A 协议,2025 年 6 月捐给了 Linux Foundation。到那一步,外脑才更像一个器官:它属于你,四肢可以换。
云端:让外脑随时在场
把外脑部署到云端服务器,手机和电脑访问的就是同一份记忆。技术上没有悬念:MCP 的 Streamable HTTP 传输为远程 server 设计,多 agent 系统里”长任务状态用外部文件续接”也是同一模式。做法上我倾向混合:记忆目录以本地为准,云端只做同步和入口,agent 的执行环境放云端沙箱。这样在手机上发一句”把昨天的会议纪要整理进 semantic”,到家时整理已经完成,本地的权威副本没动过。
需要设计的还有访问控制。注册清单里每个 workspace 声明自己能被谁读、能写哪个分区;外脑对人是全量,对干活的 agent 给视图。集中是为了共通,访问控制是为了集中不至于变成裸奔。至于代价,一个云端目录集中了一个人的全部经历和决策理由,单点泄露的后果被放到最大,这正好引到下一节。
局限与代价
- 错误记忆会被放大。agent 对记忆库没有天然的怀疑,一条错的结论写进 semantic 后会被反复引用。文件不遗忘,污染比人脑更难清除。产品侧公开的问题(记忆条目与任务错配、注入攻击可以写入记忆)在自建外脑上同样存在。
- 结构会腐烂。PARA 的 Area 和 Resource 边界从第一天起就模糊;Zettelkasten 的模仿者经常只复制了卡片格式,没复制产出闭环。目录约定一样,没有整理 skill 和使用纪律,外脑会退化成一个大的下载文件夹。
- 认知外包本身有争议。Rupert 2004 年的批评值得记住:认知科学用”嵌入认知”就能解释工具协作,不必把外部过程算作心智的一部分;对等原则推到极致,任何顺手的小抄都能算记忆,他管这叫 cognitive bloat。工程上我接受这个批评的温和版本:外脑算不算”我的记忆”不重要,重要的是它稳定、可用、被信任,这恰好也是 Otto 笔记本成立的条件。
- 隐私集中化。上面说的单点问题在云端部署时会进一步放大。本地优先和开放格式是部分回答,不是全部。
- 过度代理。这条最隐蔽:如果 agent 替你回忆、替你整理、替你决策,你对过往的”清醒”就只是代理的清醒。外脑的收益前提是人还在回路里:日志自己写,决策自己做,agent 负责让证据就位。
第⑤节的注册检查、开放格式、本地优先就是冲着这些约束去的。
结语
外脑不是一次软件选型,是一份约定:记忆按什么分类,由谁执行,新的 workspace 怎么进来。它把延展心智里的那个思想实验往前推了一步:Otto 的笔记本这次带上了执行接口,而且愿意让任何一个 agent 来用。
延展心智给笔记本列的条件大致是稳定、可靠、随时可用、被信任。前三个工程都能解决,第四个工程给不了。当 agent 替你记住的东西比你自己记住的还多,那份记忆还算不算你的,这个问题我还没有答案。
参考文献
- Clark & Chalmers, The Extended Mind, Analysis 58(1), 1998. https://consc.net/papers/extended.html
- Wikipedia(存档),Exocortex. http://web.archive.org/web/20130312083313/http://en.wikipedia.org/wiki/Exocortex
- Forte Labs, The PARA Method. https://fortelabs.com/blog/para/
- zettelkasten.de, Introduction(存档). https://web.archive.org/web/20241223203505/https://zettelkasten.de/introduction/
- Sumers et al., Cognitive Architectures for Language Agents, arXiv:2309.02427. https://arxiv.org/abs/2309.02427
- Packer et al., MemGPT: Towards LLMs as Operating Systems, arXiv:2310.08560. https://arxiv.org/abs/2310.08560
- Chroma, Context Rot: How Increasing Input Tokens Impacts LLM Performance, 2025-07. https://research.trychroma.com/context-rot
- Anthropic, Effective context engineering for AI agents. https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
- Anthropic, Equipping agents for the real world with Agent Skills. https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills
- Agent Skills Specification. https://github.com/agentskills/agentskills/blob/main/docs/specification.mdx
- Chhikara et al., Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory, arXiv:2504.19413. https://arxiv.org/abs/2504.19413
- Park et al., Generative Agents: Interactive Simulacra of Human Behavior, arXiv:2304.03442. https://arxiv.org/abs/2304.03442
- Farnam Street, Decision Journal: A Tool for Better Decisions. https://fs.blog/decision-journal/
- The Independent Review, How Big Things Get Done(书评,含 Flyvbjerg 项目数据库统计). https://www.independent.org/tir/2023-fall/how-big-things-get-done/
- Klein, Performing a Project Premortem, Harvard Business Review, 2007-09. https://hbr.org/2007/09/performing-a-project-premortem
- AGENTS.md 官方仓库. https://github.com/agentsmd/agents.md
- Claude Code, Memory 文档. https://code.claude.com/docs/en/memory
- Model Context Protocol, Architecture 规范(2025-06-18). https://modelcontextprotocol.io/specification/2025-06-18/architecture/index
- MCP Registry 官方仓库. https://github.com/modelcontextprotocol/registry
- Anthropic, Developing a computer use model, 2024-10. https://www.anthropic.com/news/developing-computer-use
- Xie et al., OSWorld: Benchmarking Multimodal Agents on Open-Ended Tasks in Real Computer Environments, arXiv:2404.07972. https://arxiv.org/abs/2404.07972
- Claude Sonnet 4.5 模型页(OSWorld-Verified 61.4%). https://vercel.com/ai-gateway/models/claude-sonnet-4.5/about
- Anthropic, Computer use tool 官方文档. https://platform.claude.com/docs/en/agents-and-tools/tool-use/computer-use-tool
- Anthropic, How we built our multi-agent research system, 2025-06. https://www.anthropic.com/engineering/multi-agent-research-system
- Google Cloud, Agent2Agent 协议捐赠 Linux Foundation 公告, 2025-06. https://developers.googleblog.com/en/google-cloud-donates-a2a-to-linux-foundation/
- OpenAI, Memory and new controls for ChatGPT, 2024-02. https://openai.com/index/memory-and-new-controls-for-chatgpt/
- Rupert, Challenges to the Hypothesis of Extended Cognition, Journal of Philosophy 101(8), 2004. https://philarchive.org/rec/RUPCTT
- Unwire, Meta 收购 Limitless 报道, 2025-12. https://unwire.hk/2025/12/09/meta-limitless-ai-wearable/life-tech/
- Obsidian, About 帮助文档. https://obsidian.md/help/obsidian