Skip to content

OpenAI Codex七大核心能力:30分钟掌握95%的能力

2026年4月30日

一位知名AI开发者Riley Brown发布视频"Learn 95% of Codex in 30 minutes":OpenAI Codex已不只是一个写代码的工具,而是一个能完成"任何知识工作+编码工作"的桌面级AI智能体超级应用。

Codex与ChatGPT/Claude的根本区别

工具文件存储本机权限
ChatGPT / Claude云端对话沙盒
Codex本地真实文件系统完整读写+浏览器+操作系统控制

这一差别决定了Codex不是"更强的ChatGPT",而是更接近Claude Code/Cursor Agent那一类——面向真实工作流的本地代理,但配了一个对非开发者也友好的图形界面。

七大核心能力

能力1:Full File Access(完整文件访问)

演示场景: 把60多张收据图片放在Downloads/receipts to process下,让Agent进行OCR、分类、汇总,最终生成带dashboard的Excel。

关键点:

  • Agent通过本机路径直接读取原始文件
  • 输出物(xlsx)保留在本地,可一键"Open in Folder"定位

工程含义: 把Agent的"工作记忆"显式映射到文件系统,这是Claude Code的设计哲学,但Codex把它包装成普通用户也能理解的"项目+聊天"模型。

能力2:Persistent Memory(持久化记忆)

Codex区分两类记忆:

类型文件位置写入者用途
手动记忆AGENTS.md你(或让Agent写)长期遵守的偏好、规范
自动记忆~/.codex/memories/Agent自己维护对你工作模式的观察

实操建议:

  • 想固化偏好,直接对Agent说"请记住",它会写进AGENTS.md
  • 不要手动改自动记忆文件,让Agent自己维护,定期阅读能反向了解Agent对你的画像

能力3:Plugins(插件/外部连接)

Plugins是Codex与外部SaaS(Slack、Gmail、Notion等,当前已超过100个)打通的连接层,相当于MCP的产品化封装。

演示场景:

  • Gmail插件:翻过去两周邮件,找出所有想找你做付费推广的品牌方,5分钟产出品牌方清单
  • Notion插件:从你的Notion读取高质量长视频脚本,学习写作语气,生成"听起来就是你本人写的"草稿

调用方式:输入@弹出插件菜单,体验对标Cursor的@选择器。

能力4:Skills(技能/可复用SOP)

Skills是"reusable workflow recipes"——让Agent每次遵循的指令文件,存放在plugins/skills/下,调用方式是/skill_name

两种创建方式:

方式说明
Prompt-to-Skill一句话"创建一个叫X的skill,做Y",简单但效果一般
手工迭代后萃取(推荐)先打磨到满意,再说"请把它沉淀为一个skill"

关键洞察: 每一次使用旧skill,都是迭代它的机会——发现新亮点直接说"以后都这样做",让Agent更新skill文件。

Plugin vs Skill的边界:

  • Plugin = 与外部系统的"连接+工具"
  • Skill = 用这些工具做某件事的"流程指令"
  • 一个Skill可以调用多个Plugin

能力5:GPT Image Access(原生图像生成)

Codex内置GPT-image-2(当前OpenAI最强图像模型)。

演示: 上传一张毛衣样图,让Agent生成5张不同人种模特、不同人数穿着该毛衣的产品图。

工程亮点: 图像生成以内置skill形式存在,与第三方skill平起平坐——所有内置能力都用Skills这套抽象统一描述。

能力6:Browser & Computer Use(浏览器与操作系统级控制)

两个能力以Plugin形式提供:@computer use@browser use

Computer Use演示: 让Agent打开本机Canva客户端,新建演示文稿,把生成的5张产品图一图一页放进去。

Browser Use演示: 让Agent把生成的HTML文件转成测验应用,自己打开浏览器测试——点击Start、答题、验证答案、检查滚动行为。

这是Codex最具颠覆性的能力: 人机交互三件套(键盘、鼠标、屏幕)正式被Agent接管,任何能在GUI内完成的工作都进入Agent可达范围。

能力7:Automations(定时与触发式自动化)

任何已跑通的会话都可以"一句话变定时任务":

"请每周五早9点跑一次这个流程,并更新这张表。"

Agent会在Automations面板创建记录,包含触发时间、所用Skill、活动状态、上次运行时间等。

能力闭环:

Plugins(连接) → Skills(流程) → Automations(调度)

效果上等价于为个人量身定制的、由自然语言配置的Zapier/n8n。

彩蛋:Chronicle(环境感知记忆)

开启后,Codex会持续对屏幕进行截图采样,把视觉上下文喂给Agent。

演示: 没有上传任何文件,只说"用Chronicle看看我的演示文稿还该加些什么",Agent直接基于近期截图给出了具体补充建议。

注意: 略有侵入性(always-on屏幕录制),涉及客户数据/机密文档的环境启用前先想清楚合规边界。

Codex能力栈

[Chronicle 环境感知]   ← 视觉上下文输入

[File System 全访问] + [Persistent Memory]  ← 持久状态层

[Plugins 外部连接]    ← 工具层

[Skills 可复用流程]   ← 程序化知识层(SOP)

[Browser / Computer Use]  ← 执行层(GUI级动作)

[Automations 调度]    ← 时间维度的触发器

对个人工作流的启示

  1. 以项目文件夹为单位组织Agent工作 — 天然解决"Agent失忆"和"产出散落"两大痛点
  2. 善用AGENTS.md把品味和规范固化 — 把个人偏好"编译"为Agent行为的最低成本路径
  3. Skill不要一次写好,要在使用中演化 — 每一次"我希望以后都这样做"都是一次免费SOP升级
  4. 真正放大杠杆的是Automations — 定时跑销售线索分析、邮件汇总、内容选题、对账等高频低价值工作,是个人ROI最高的切入点
  5. 对Chronicle持谨慎态度 — 启用前先想清楚截图记录的合规边界

一句话总结

OpenAI把Codex定位为"通用知识工作Agent的桌面OS"——本地文件是状态,AGENTS.md是偏好,Plugins是外设,Skills是程序,Browser/Computer Use是执行器,Automations是cron,Chronicle是感知层。

当这套抽象被普通用户接受时,AI才真正从"对话框"走进了"工作台"。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来