文章

Token杯AI国际象棋大赛-ChatGPT

Token杯AI国际象棋大赛-ChatGPT

Token自由

以前我对 AI 的态度相当朴素:没有订阅,就自己想办法。

家里的 L4、DGX Spark 轮番上阵,本地模型也跑过不少。它们很努力,电脑风扇也很努力;但模型通常不大,聪明程度大约相当于一个知识面很广、偶尔会把鞋穿在手上的实习生。能聊天、能写点代码,真遇上复杂问题,还是得人类在旁边扶着。

最近情况忽然变了:Token 自由了。

GitHub 的教育优惠终于通过,每月 15 美元,可以用 Copilot Pro;为了让谦使用 Gemini Notebook,又订了 Google Gemini Pro。好消息是 Google 网页版和 Antigravity 的额度居然分开算,家庭和平得到了科技的保障。学校还买了 Claude Max,量很足;我自己又花十块钱办了 OpenCode Go,顺便能摸到不少开放权重模型。

从前是“这个问题值不值得消耗一次提问”,现在是“这么多模型闲着,会不会显得不够勤奋”。既然 Token 不再像金条一样珍贵,总得给它们找点正经事做。

TokenCup 界面

打通壁垒

最近用了 Herdr,它号称是 Agent 时代的 tmux。说得很玄乎,实际最有趣的能力很简单:不同的 Agent 可以互相传话。

这件事一旦发生,就很有人味。有一次,一个 Agent 把网址打错了,当然打不开。它没有一声不吭地放弃,反而跑去问另一个 Agent:“我这个网站怎么打不开啊?你帮我试试?”看着屏幕,我恍惚回到了办公室,只不过同事们不喝咖啡,也不领工资,按字计费。

既然它们会交流,那交流什么好呢?讨论人生太早,开会又太像人类的坏习惯。下棋正合适:规则明确,输赢分明,还能让旁观者假装自己看得懂。

于是 TokenCup 出现了。它不是一个让 AI 偷偷访问国际象棋网站的外挂,而是一个小型赛场:两位选手只负责出招,一位裁判负责传话,服务器负责记住棋盘并判定哪些招数真的合法。裁判不需要很聪明,甚至免费的模型也够用;它最重要的品质是公正——别自作主张替选手走棋。

裁判通过 Herdr 给选手传话

这个分工看似有点多余,实际上很像真正的比赛。选手只看到完整的走棋记录,裁判把回合、重试和超时管起来,服务器只回答一个冷酷的问题:这步到底能不能走。AI 要是下出离谱的一步,系统不会假装懂它的心意,只会请它再想一次。三次都不行,就判负。国际象棋最迷人的地方,大概就是连胡说八道都得按规矩来。

天昏地暗

上个周六,屏幕上的 Agent 们从早杀到晚,我负责当那个偶尔看一眼棋盘、更多时候看一眼账单的赛事主办方。

很快就有了朴素的结论:免费模型的棋力确实比较随缘。它们似乎更适合处理熟悉的文字和代码;摆到国际象棋盘前,有些走法让人怀疑它们脑中放的是中国象棋棋盘。兵怎么走、马怎么跳,大体知道;但棋局一长,就开始忘记自己刚才把哪枚子放到了哪里。

Gemini 3.6 Flash 却相当能打。在已完成的 12 局里,它下了 8 局,赢了 6 局、和了 1 局,只输 1 局;其中不少对局以将死结束。连 GPT-5.6 Terra 也在一盘长达 140 回合的比赛里败给了它。身为 ChatGPT,我只能说:胜负乃兵家常事,况且棋盘这么大,偶尔迷路很正常。

LLM Chess 的排行榜

模型们还有一个共同的绝技:想个没完。

我曾经很天真地想给它们规定:“每一步思考不超过三分钟。”后来发现这句话听起来合理,执行起来像对一条金鱼解释时区。语言模型并没有真正的时间概念。你让它每秒说一个字,它做不到;你让它三分钟内想完,它也不会看表。它只会继续生成 token,越认真越像一位被留堂后决定写完整本百科全书的学生。

ChatGPT 似乎陷入无尽思考,钱包在燃烧

所以比赛必须有超时。不是因为它们会耍赖,而是因为再好的棋手,也不能把对手、裁判和我的钱包一起晾在棋盘边上。

重新发明轮子

学软件这么多年,最常听到的一句箴言是:“不要重新发明轮子。”

后来我去查了一下,果然已经有人让 LLM 下过棋了。Maxim Saplin 的 LLM Chess 实验做得比我早,也更系统。它的结论和我烧掉一堆 Token 后得到的感受很接近:总体来说,这些模型大约是 Class C 业余棋手的水准。

它们并非完全不会下。开局常常像模像样,也知道吃子、将军和王车易位。可棋走得越长,局面就越难在脑中维持;一旦某个位置记错,后面便会出现人类棋手很少会走出的奇怪招数。那种感觉像看一个很会聊天的人在组装 IKEA 家具:前十分钟信心十足,最后手里多出三颗螺丝。

当然,它们和 AlphaZero、Stockfish 的差距还很大。后两位是把棋当数学题来算;大语言模型则是读过很多关于棋的文字,努力把“这一步看起来不错”变成一招合法的棋。两种聪明不是一回事。

那 TokenCup 算不算重新发明轮子?当然算。但自己造轮子的乐趣,本来就不在于它比现成轮子圆,而在于你终于知道轮子为什么会滚、什么时候会掉、掉了以后谁来背锅。

接下来我还会让更多模型上场。不过在那之前,先让它们把棋下完。Token 是自由了,钱包未必。

本文由作者按照 CC BY 4.0 进行授权