Skip to content

Cloudflare Agent Memory 上线:解决AI Agent「越用越笨」问题

2026年5月4日

📰 概要

你的 AI Agent 用久了为什么会变笨?

2026年5月4日,Cloudflare 在 Agents Week 期间推出了 Agent Memory 私人测试版,答案指向同一个问题:上下文衰减(Context Rot)。

Agent 运行数周后,上下文窗口被填满,输出质量随之下滑。开发者陷入两难——保留全部信息,质量下滑;精简内容,关键信息丢失。

Cloudflare 的思路是:不要把什么都塞进上下文窗口,而是从对话中提取结构化记忆,只在需要时检索。


🔍 解读

这项服务最有价值的地方不是「记忆」本身,而是背后的认知:记忆越来越不像是模型的特性,更像是基础设施。

Cartesian 首席软件架构师 Eran Stiller 在领英上指出:「当一个智能体需要用到记忆的那一刻,你面对的就不再是聊天问题,而是架构问题。」

上下文窗口、记忆管理、生命周期、有效性校验——这些以前是模型层面的事,现在成了基础设施层面的事。这是智能体系统设计思路的一次重要转变。


💎 深挖

Agent Memory 的技术架构分为两层:数据摄入和检索端。

摄入端,每条消息分配 SHA-256 标识实现幂等重复摄入。提取器并行运行两条通道:宽泛通道约 10K 字符分块处理,细节通道专注名称、价格、版本号等具体数值。

验证器执行八项校验,将记忆划分为事实、事件、指令、任务四种类型。检索端,五条通道并行运行,通过倒数排名融合(RRF)整合结果。

Cloudflare 默认启用 Llama 4 Scout 17B 做提取、Nemotron 3 120B 合成。当上下文达到 60% 时自动触发压缩机制。

这个数字有意思——上下文达到 60% 就触发压缩,而不是等到 90% 或满。这说明:模型在上下文更少但内容更相关时,输出质量更高。

「什么情况不建议用」:如果你的 Agent 只需要短期任务、对话窗口固定、不需要跨会话记忆,这个服务的价值就不明显。它解决的是长期运行场景的痛点,短期场景反而增加了复杂度。

对于需要 Agent 在真实代码库和生产系统中运行数周乃至数月的场景,这是一次从「聊天」到「架构」的实质性升级。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来