Skip to content

OpenRA-RL开源红警AI训练场:大模型经济满分战斗零分

2026年4月29日

📰 概要

2026年4月28日,Hugging Face 发布了一个有意思的开源项目——OpenRA-RL。 它把经典游戏《红色警戒》改造成了AI Agent训练场。

团队用 Qwen3 32B 模型上阵测试,对阵最弱的 Beginner AI。 跑了5局,经济运转得不错,但一仗没打——全平局,战斗和骚扰得分归零。

这不是玩具Demo。50个MCP游戏工具、25Hz实时状态流、64局并发训练,支持LLM、脚本Bot和强化学习三条路线。一台消费级显卡就能跑。


🔍 解读

OpenRA-RL 的意义不在于"大模型能打红警",而在于它把RTS Agent训练门槛降到了可操作的程度。

之前 DeepMind 的 AlphaStar 打星际要几千块TPU,OpenAI Five 打Dota用定制架构,普通研究者连门在哪都找不到。 OpenRA-RL 一行 pip install 就能上手——这是本质区别。

说白了,之前RTS Agent研究是"只有DeepMind能做的事",现在变成了"你也能做的事"。

Qwen3 32B 经济满分战斗零分,暴露了纯上下文学习的天花板。 模型能通过提示学建造顺序,但学不会进攻——这正是强化学习该出场的地方,用权重更新代替提示注入。


💎 深挖

OpenRA-RL 的架构分三层:

底层是魔改过的OpenRA游戏引擎(C#),以25Hz频率跳动。 中间是gRPC桥接层,实时推送观测数据、接收操作指令。 上层是Python封装,暴露Gymnasium风格接口,MCP服务器把50个游戏动作暴露为工具。

核心思路:Agent的计算和游戏执行完全解耦。 一个40毫秒一步的脚本Bot和一个2秒一步的LLM,跑在同一个25Hz引擎上,互不干扰。

工程上最亮眼的优化是并发架构。早期版本一局游戏一个.NET进程,64局约40GB内存,每次重置5-15秒。 v2用一个进程承载64个会话,利用ModData在初始化后不可变特性一次加载共享,内存降到约6GB,重置延迟降到256毫秒。

对比来看,AlphaStar 和 OpenAI Five 证明了AI能在RTS达到超人水平,但成果被锁在高墙之后。 OpenRA-RL 第一次推倒了一部分墙——一台消费级显卡,一行 pip install,你就站在了同一条起跑线。

什么情况不建议用?如果你的目标是训练一个能打赢人类职业选手的红警AI,底层 OpenRA 引擎跟原版西木红警有行为差异,训练策略不一定能迁移。 它更适合做AI Agent的基础能力研究和RL训练实验平台。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来