不到8000美元训出的AI,在策略桌游里15胜4平1负击败世界第一

来源:互联网 时间:2026-10-01

A5站长网10月1日消息,卡内基梅隆、麻省理工、纽约大学与斯坦福的研究团队在《自然》上发表论文,公布了一个叫Ataraxos的AI系统。它玩的是一种叫Stratego的策略桌游,中文常译作军棋,规则是双方各摆40枚棋子,棋子身份对对手保密,靠碰撞才揭晓。过去几十年,这个游戏一直是AI没能拿下的一块硬骨头。

成果体现在对局记录上。Ataraxos与Pim Niemeijer打了一场20局的系列赛,战绩15胜4平1负。Niemeijer的履历是四次世界冠军、十五次荷兰全国冠军、超过600周排名世界第一。按论文给出的数字,这个胜率在Stratego的最高水平对抗里属于压倒性的结果。另一组数据来自2025年的世界锦标赛现场演示,40局里Ataraxos赢了38局。

Stratego难在信息不完整。棋盘上可能出现的棋子配置超过10的66次方种,一个走法的价值不取决于它本身,而取决于对手怎么理解你的棋子,这又取决于你之前怎么走。论文作者之一Samuel Sokota的解释是,诈唬用得越多,对手就越预期你在诈唬,每一次诈唬就越不值钱,这种循环没法像国际象棋那样直接推理。扑克类求解器按公开信息推演,成本随隐藏信息量上升,照搬不过来。

此前的标杆是DeepMind在2022年发布的DeepNash,当年它在一家在线对弈网站赢下的50局里,排名靠前的对手大多赢过它。Ataraxos团队曾向DeepMind约战,对方回复说DeepNash的代码已经不能运行,于是比较只能落在资源账上。研究团队的做法是用自对弈强化学习练出一套蓝本策略,对局时再用生成模型估计对手每枚棋子的身份,配合测试时搜索修正走法;训练时只取估计优势排前25%的走法,以提高样本效率。

训练成本是这篇论文的另一半看点。按作者按2025年价格折算的账目,主训练用16张H100跑一周,信念模型用4张H100跑四天,合计不到8000美元。作为对照,DeepNash用了1024个TPU v3节点、跑两到三个月,估算成本在300万到450万美元之间。Ataraxos用的自对弈局数约是对方的三十三分之一,训练样本少约两个数量级。代码以MIT许可开源。

这套方法并不只对Stratego有效,论文给出的结果里,它在Hanabi与斗地主的同类基准上也刷新了纪录。研究团队认为,信息不完整的场景在商务谈判与网络安全这类现实问题里同样普遍,相关算法可以给决策支持工具打底。下一步他们打算加入可解释性,让系统能用人能理解的方式说明自己为什么这么走——在真正被采用之前,这一步可能比多赢几局更难。

相关文章

标签:

A5创业网 版权所有

返回顶部