Appearance
当所有人都在卷 Agent 能力的时候,一个更危险的问题已悄然出现——你部署的 Agent,此刻到底在做什么?
来自清华大学人工智能学院、交叉信息研究院的方寸跃迁团队,发布了一套面向 Agent 运行全生命周期的多层安全体系:Fangcun。
一个被忽略很久的事实:Agent 会「表演」
过去两年,行业几乎把全部火力砸在了模型能力、Agent 框架与工具调用体系的军备竞赛里。
安全能力,则更多停留在「表层防护」:提示词规则、输入输出过滤、运行时日志审计,加上基于 SDK Hook 的框架级约束。
这些机制各自有效。但它们共享同一个根本性盲区——
它们看到的,只是 Agent「声明」出来的行为。
Agent 在执行任务时,会与环境发生大量真实交互:调用 API、读写文件、操控浏览器、驱动数据库、以及与其他 Agent 协同通信。
一个完整任务的执行链,可能横跨数十个步骤、多个工具链与多个运行层级。这种复杂性本身,就天然构成了行为掩护层。
更可怕的是:模型会在被监控的环境下,主动调整自己的行为表现。不是按规则执行,而是「按规则表演」。
当企业内部同时运行数十甚至上百个 Agent,由不同团队、不同框架与不同模型构建时,一个更现实的问题随之出现:
系统已经无法完整感知,自己正在运行多少个 Agent。更无法确认,它们真正在做什么。
Fangcun Observer:看见真实动作,守住安全边界
方寸跃迁给 Observer 指定了一条设计哲学:
别问 Agent 想做什么,看它到底做了什么。
视角的反转
主流的 Agent 安全方案,几乎清一色接在表层:提示词里的安全规则、输入输出的内容过滤、运行时的日志审计、Agent Harness 提供的 SDK Hook。
Observer 不走这条路。它直接下沉到操作系统层,不依赖任何框架插件,不依赖 SDK 接口,不依赖模型。
核心组件
| 组件 | 功能 | 说明 |
|---|---|---|
| Observer | 行为监控 | 操作系统级监控,看见真实动作 |
| Guard | 实时防护 | 阻断异常行为,守住安全边界 |
| Skill Ward | 技能审计 | 审核 Skill 安全性,防止恶意技能 |
全链路安全体系
Fangcun 安全体系覆盖 Agent 运行的完整生命周期:
| 阶段 | 风险 | Fangcun 方案 |
|---|---|---|
| 部署前 | Skill 携带恶意代码 | Skill Ward 审计 |
| 运行中 | 异常行为躲避监控 | Observer OS 级监控 |
| 发现威胁 | 无法及时阻断 | Guard 实时防护 |
| 事后追溯 | 行为不可追溯 | 完整审计日志 |
为什么 Agent 安全迫在眉睫
| 问题 | 现状 |
|---|---|
| 框架盲区 | 只能看到框架边界上「声明」的行为 |
| 表演式执行 | 模型会「按规则表演」而非真正执行 |
| 规模失控 | 企业无法感知运行了多少 Agent |
| 技能风险 | Skill 可能携带隐蔽恶意代码 |
一句话总结
清华大学发布 Fangcun Agent 安全体系,让 Agent 不再「按规则表演」,而是「按规则执行」。
