Appearance
📰 概要
2026年5月4日,Cloudflare 在 Agents Week 期间宣布 Agent Memory 开启私人测试。这项服务为 AI 智能体提供跨会话、持久化的记忆能力。
不需要把所有内容都塞进上下文窗口,而是从对话中提取结构化记忆,只在需要时检索。这就是业界所说的"上下文衰减"(Context Rot)问题的解法。
🔍 解读
上下文衰减是个听起来技术、实际很致命的问题。
就算上下文窗口突破百万级词元,研究表明:上下文被填满后,模型输出质量会随之下降。开发者陷入两难:要么保留全部信息但质量下滑,要么精简内容但丢失关键信息。
更反直觉的是,研究还表明:模型在上下文更少、但内容更相关的情况下,输出的质量反而更好。Agent Memory 的核心逻辑就在这里——不是记住更多,而是记住更相关。
Cartesian 首席架构师 Eran Stiller 在领英上说:"当一个智能体需要用到记忆的那一刻,你面对的就不再是聊天问题,而是架构问题。"
💎 深挖
在数据摄入端,每条消息都会分配一个基于内容寻址的 SHA-256 标识,实现幂等重复摄入。
提取器并行运行两条通道:宽泛通道以约 10K 字符为单位分块;细节通道专注于名称、价格、版本号等具体数值信息。
验证器在分类前执行八项校验,将记忆划分为四种类型:事实、事件、指令和任务。事实与指令按照归一化主题进行键值管理,新增记忆会覆盖旧有记忆,而非直接删除旧记忆。
在检索端,五条通道并行运行,通过倒数排名融合(RRF)整合结果。分别对应:全文搜索、精确事实键查找、原始消息搜索、直接向量搜索,以及 HyDE 向量搜索。
Cloudflare 默认使用 Llama 4 Scout(17B MoE)完成信息提取与分类。
内容合成时才切换到更大的 Nemotron 3(120B MoE)。
这说明提取和分类不需要最大的模型。
「什么情况不建议用」:如果你的 AI Agent 是短时单轮对话,不需要跨会话记忆,那这个服务的价值很有限。
但如果你在构建需要在真实代码库和生产系统中运行数周乃至数月的智能体,这种持久化记忆能力可能是决定项目能否成功的关键。
