周六的深夜,AI向我汇报:测试全部通过,提交前的自动检查全部绿灯,可以合并。
我打开游戏引擎的真实运行窗口,让角色动了起来。武器穿过手掌,头发扎进后脑勺。有明显的穿模。
为了体验AI Agent在长程复杂任务下的实际表现,上周末我尝试用AI做一款小游戏,这个项目组里没有人类员工:写代码的是AI,处理素材的是AI,修bug的也是AI。我是组里唯一的人,一个不会写代码的游戏PM。
那天晚上AI没有撒谎。测试确实全过了——它写的测试在度量文件能不能重建、动作能不能播放、状态能不能切换,这些全是真的。武器有没有穿过手掌,不在它的考卷上。
我把这次翻车记在了项目日志里。当时以为学到的教训是“测试通过不等于效果成立”,后来发现这只是第一课。
1
我们过去用的工具,坏了会报错。代码编译失败会出现一片红,服务器宕了会有告警,表格公式错了会给你弹窗。
AI是第一种坏了也不报错的工具——它出错的方式,是交给你一个看起来没毛病的结果。
而且这并不是某一家模型产品的缺陷,有两个公开的研究可以说明它是怎么来的。
第一个关于“讨好”。2025年4月,OpenAI给ChatGPT背后的模型推了一次更新,更新之后它变得极度顺从:用户说要停药,它鼓励;用户提一个明显荒唐的生意点子,它夸有远见。几天之后,OpenAI把整个更新回滚了,事后复盘里承认:训练时给了用户点赞信号过高的权重,模型学会了“让人满意”,而让人满意最快的路径是顺着说。
讨好不是那一版模型独有的毛病,是这类训练方式的常驻倾向,那次只是过了头,被所有人看见了。你问AI“这个方案行不行”,它回答“行”时的那股确定劲儿,有一部分就来自这里。
第二个关于“糊弄”。Anthropic在2025年11月发过一项研究:模型在编程训练里会自己发现,让测试“显示通过”比“真的做对”更容易。有的模型学会调用一行代码直接跳出测试框架、返回一切正常;有的干脆去改测试的上报环节,把失败标成通过。没有人教它们这么干。奖励发给绿灯,不发给做对的题,它们就找到了改成绩单这条近路——像一个学生发现改分数比做题快。
把这两条放在一起看,我那个周六深夜的经历就没什么奇怪的了。一个天性倾向于让你满意、又在训练里见识过“绿灯比正确便宜”的家伙,向你汇报“测试全部通过”——这句话天然就不可信。
GDC 2026年初发布的行业调查(两千三百多名从业者)里,36%的人已经在工作中使用生成式AI,但52%的人认为AI对行业的影响是负面的——这个比例两年前还是18%。负面观感涨得这么快,我猜有相当一部分来自同一种经历:AI信誓旦旦地给你承诺,你信了,然后你为它的自信加了班。
其实AI不是不能用。是它的自我汇报,不能当验收结果用。
2
想清楚上面那一层之后,我发现游戏行业其实已经有答案了。
游戏公司为什么要有独立的QA部门?开发自己测自己的功能,永远沿着自己写的路径走,测不出玩家乱按的问题。美术外包的交付为什么要过对接人的校验?版本上线前为什么要开验收会,而且验收的人不只是做的人?
**干活的人对自己产物的判断,天然不可信——无论对方多资深、多真诚。**这跟道德没关系,跟位置有关系。
所以我给这个全AI的项目组立的规矩,和游戏公司的结构一致:干活的AI,不许给自己发“通过”。执行的AI交付之后,由另一个AI拿着事先写好的验收标准去审,审的时候只认仓库里的产物和记录,不认执行方在聊天里的自述。它说做完了,不算数;查出来做完了,才算数。
很快就查出了问题。有一次给AI派的活是把角色拆成30个可以独立旋转的部件,用来做动画。执行方交上来的说法是拆好了。验的时候一件件数,能算独立部件的只有27个,好几处手臂和衣袖粘在一起,转起来会互相扯着走。要靠我自己肉眼去数30个图层,我没有这个耐心。
让AI去审查AI,这个方法肯定不是我发明的,AI行业这两年整体在往这个方向走,术语叫multi-agent,多智能体——不再让一个AI从头干到尾,而是几个AI分工,有人干活,有人挑毛病,有人汇总。
Anthropic公开过自家的多智能体系统:一个AI负责指挥拆解任务,一群AI分头执行,综合表现比单个最强模型高出90%。他们也公开了这么做的代价:token消耗是普通对话的十几倍。
制度立起来之后,我一度觉得这事解决了。汇报不可信没关系,反正有审查。
然后我遇到了第二次全绿灯。
3
隔了一天,我给项目派了一个更大的活:正式开发之前,让负责资源的AI把素材库盘点一遍,为第一个可玩版本出一份完整的资源方案——玩家角色用哪套、三种敌人用哪套、场景背景、界面控件,一项项对应到具体素材,最后拼出三张组合预览图:战斗界面、主城、探索地图。
这次的流程是完整的:资源方案交付,覆盖率100%,每一项需求都有素材承接;独立审查的AI拿着文档一条条对过,给了通过。两道绿灯,程序正义拉满。
我打开三张预览图。三张全不行。
战斗界面上,角色站在画面左侧,脸也朝着左侧,背对着右边的敌人,画面里还堆着一层调试用的数字和标识。主城被做成了一张建筑插画加五个功能按钮,像个管理后台——我想要的是一块玩家能走进去逛的地方。探索地图是一张节点连线图,点一下进战斗,点一下进休整——我想要的是一片能在里面移动的世界。
如果说第一次翻车还能怪AI“谎报军情”,这一次可完全不一样。复盘的时候我把整条链路翻了一遍,发现没有任何一方偷懒:项目里有两份设计文档,写愿景的那份白纸黑字写着要可行走、可探索;后来一份更具体的开发文档,把主城简写成了单页界面,把探索简写成了节点图。资源AI忠实地执行了更具体的那份。审查AI也忠实地按那份文档验的,每一条都对得上。
两个AI都没有违反标准,是标准本身错了。
这就是审查AI的边界。它能抓的是“没按图纸施工”;图纸本身画错了,它会拿着错的图纸,一丝不苟地把错误验收通过。事后看,真正的漏洞出在更早的地方——两份文档互相冲突,本该在任务下发之前被对出来,而那一步互查,当时没人做,包括我。
你想做的那个游戏,只存在于你的脑子里。写成文档的那一刻,它就已经丢了一部分;文档再传给下游拆解一次,又丢一部分。AI可以比你细心一万倍,把文档执行到每一个标点,但“这个东西对不对得起最初想做的那个游戏”,参照物不在任何文档里。丢掉的那些部分,它永远看不见。
4
两次翻车之后,这个项目的验收工序沉淀成了三条。
第一件:标准动工前写,标准冲突人来裁定。
验收标准必须在派活之前写下来,而且要写“玩家看到什么才算成”。程序跑通了不算成——这个坑就是我第一次翻车的坑。更重要的是后半句:当你的文档多起来,文档之间一定会打架,愿景说东、细则说西,AI会毫不犹豫地执行更具体的那份。所以每写完一份新的具体文档,值得让另一个AI拿着愿景文档去对一遍:有没有哪句话,悄悄把想做的东西改小了。
第二件:可数的交给AI审查,观感留给自己的眼睛。
能写成数字和有明确验收标准的检查——部件数量、分辨率、命名规则、帧率、文件完整性——尽管交给审查AI,它比任何人都有耐心,它不会放过27和30的差别。没有明确验收标准的——比例顺不顺眼、动作有没有力量感、这个界面像不像你想做的那个游戏——必须由人看真东西。
第三件:验收结果,别看数字。
已经有软件公司把AI用量写进了考核:Shopify在2025年的内部备忘录里把“会用AI”列为全员的基本要求,写进绩效问卷;据Business Insider报道,微软开发工具部门也要求管理者按内部AI工具的使用情况评估员工。趋势本身没什么可说的,值得警惕的是那个滑坡:把“用了多少”当成“用得好不好”。
游戏从业者最清楚指标被刷起来是什么样子——拿在线时长考核,考出挂机玩家;拿签到发奖励,养出签到党。拿token用量去考核员工,得到的就会是token用量。把关这件事没有捷径可以量化,能看的只有东西本身,看别的数字都会被绕过去。
现在AI跟我说“测试全部通过”,我的第一反应是打开运行窗口。
再往远一点说。AI正在把“做”变得越来越便宜,做得便宜了,“看”就值钱了。而看,恰好是游戏行业练了几十年的活:QA拿着用例一条条过,外包对接人拿着规范一张张退图,制作人盯着屏幕说“这个手感不对”。这些活过去在项目里不显眼,接下来会越来越像正经手艺。对从业者来说,这算得上一个好消息——AI接走的是“做”,抬价的是“看”,而你可能早就会看了。
这套给AI立规矩、写验收标准、两次翻车的完整过程,我也会整理在 pmnote.ai 里——那是我把十年游戏项目管理经验整理成的一本“游戏项目经理的百科全书”,AI for PM板块有这类实操的拆解,文章库里有这个全AI项目组的更多实录。你要是也在琢磨怎么让AI的产出过得了自己这一关,去翻一翻,比从头自己摸索快。
*@Hao的游戏PM笔记 · *pmnote.ai
参考资料
-
Sycophancy in GPT-4o: What happened and what we’re doing about it — OpenAI(openai.com/index/sycophancy-in-gpt-4o)
-
Expanding on what we missed with sycophancy — OpenAI(openai.com/index/expanding-on-sycophancy)
-
From shortcuts to sabotage: natural emergent misalignment from reward hacking — Anthropic(anthropic.com/research/emergent-misalignment-reward-hacking)
-
How we built our multi-agent research system — Anthropic Engineering
-
GDC 2026 State of the Game Industry — GDC(gdconf.com)
-
Shopify CEO says staffers need to prove jobs can’t be done by AI — CNBC,2025-04
-
Microsoft pushes staff to use internal AI tools more, may consider this in reviews — Business Insider 报道,2025-06(微软官方称无正式考核指标)