Think Deep,Work Lean

同一件事,一家花 450 万美元,一家花 8000 美元

Posted on By zack

大家好,我是Zack。

今天早上刷我自己的 AI 日报站,热榜第二条是条棋盘游戏的新闻。一开始我没当回事,点进去看完,又读了一遍。

因为它讲的是同一件事,两家做出来的代价差了几百倍。

今天最值得看的一条

这个系统叫 Ataraxos,MIT、CMU、NYU、Stanford 四家联合做的,论文发在 Nature。

它干的事是:在西洋陆军棋(Stratego)里,赢了人类历史上最强的人类选手。

先说这游戏为什么难。双方各 40 枚棋子背面朝下摆好,你看得见自己的,看不见对手的,只有棋子撞上才知道谁的级别高。初始布局超过 10 的 33 次方种。国际象棋状态空间更大,但信息完全公开;西洋陆军棋难的不是”算得远”,是你根本不知道对面是什么,只能一直带着不确定性做决策。

对手叫 Pim Niemeijer,四次世界冠军、十五次荷兰全国冠军,累计六百多周排在世界第一。正式比赛 20 局:Ataraxos 15 胜 1 负 4 平。

但真正让我读第二遍的不是战绩,是成本:

  • Ataraxos:16 张 H100 训一周,再用 4 张卡花四天训它的”信念网络”,按 2025 年价格算,不到 8000 美元。
  • DeepNash:DeepMind 2022 年的系统,1024 个 TPU 节点训两到三个月,论文估算 300 万到 450 万美元。

而且 DeepNash 并没有真正赢下最顶尖的人类选手。2023 年世锦赛它 28 局赢了 19 局,但输给了包括 Niemeijer 在内的几位顶尖选手。

Ataraxos 用了大约 1/500 的算力、1/30 的自我对弈局数、1/100 的训练样本,做到了 DeepNash 没做到的事。

它是怎么做到的

论文里的三个关键点,我按自己的理解说:

一是训练时强迫它别”定型”。 Ataraxos 是自博弈强化学习,跟自己下棋学出来,不用人类棋谱。团队加了个正则化约束:训练中强迫它不断变换布局和走法,不许早早锁死成一套固定打法,再随训练推进慢慢放松。作用是防止训练原地打转或发散。

二是下棋时用生成模型猜对手的牌。 这是关键。面对隐藏信息穷举是不可能的,Ataraxos 的做法是:用一个生成模型按概率推断对手那些看不见的棋子大概是什么,再在这个”猜测”下评估走法——把穷举换成了概率推断。

三是定制 GPU 模拟器,把样本效率拉上去,这是成本能压到 8000 美元的硬件侧原因。

团队把代码开源了。同样这套方法搬到 Barrage Stratego、Hanabi(合作类纸牌)、斗地主,也都能达到超人水平。

我的判断:降的不是算力价,是方法成本

第一反应很容易是”算力便宜了”。我觉得这个说法不准确:H100 没降价,变的是同样的硬件,方法好了几百倍。

这对一个人做东西的人是真正的利好。过去很多事的门槛是”你有没有几百张卡”,那道门槛我永远迈不过去;现在门槛变成”你有没有想明白问题怎么拆”——这一道,一个人能迈。

我做 AI 日报站就是同一个道理。我没有更强的算力,只是把”抓信源、去重、打分、写一句为什么值得看”这个流程拆清楚了,交给 agent 每天自动跑。它不聪明,但稳定,而且标准我说了算。

另外两条

Google 开始给出版商付费了。

大约 100 家数字出版商参加了一个叫 AI Contribution Pilot 的试点:内容被 AI 摘要、AI 模式、Gemini 用在回答里,按”贡献度”给钱。

报酬差距大到离谱:小站几个月下来不到 1000 美元,不少中小出版商拿到的钱不到自己广告收入的千分之一;也有出版商累计拿到 5-6 万美元,一家早期参与的每年超过 100 万美元。规则不透明,出版商说不清什么算”有效贡献”,金额还会毫无征兆地逐月波动。目前能看出的规律只有一条:动漫、游戏这类”报道少但需求旺”的题材收益更高。

这条我是带着私心看的——我的日报站也在引用别人的内容写摘要。如果内容的价值由平台单方面判定,写东西的人只会更难。

GPT-6 Astra Ultrafast 上了 NVIDIA Blackwell。

NVIDIA 官方博客今天发的:这个模型已经在 Blackwell GPU 上跑起来,面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。

对 agent 的意义比榜单大得多。agent 是循环调用模型的,一个任务跑几十轮很正常,单次延迟降一点,整条链路省下来的是分钟级。这跟昨天 Gemini 4 Argon 把输出上限提到 100 万 token 是同一件事的两面:一面是能跑多长,一面是跑得多快。

我今天做的,和踩的坑

今天我没写多少代码,主要在跟一个很蠢的问题较劲:我想让公众号封面自动生成。

具体是:给一篇文章主题,让 Gemini 出一张宫崎骏风格的图,裁成 2.35:1,传进素材库拿到 thumb_media_id,下次推草稿直接用。脚本做完了,但真正花时间的是另一个坑——微信接口的 IP 白名单。

我的出口 IP 今天漂了三次。上午报错里是 111.60.245.239,我去后台加上,还是不通;到九点多再试,报错里的 IP 已经变成 117.151.140.167。移动宽带的出口 IP 会变,白名单写死一个 IP,基本等于随机失效。

最后的解法很原始:不用 API,改用浏览器扫码登录后台直接操作。登录态能管好几天,比 IP 名单靠谱。

今天学到的一条:任何”我在本机跑”的自动化,动手前先问一句——它依赖的东西会不会变。IP 会变、cookie 会过期、模型接口会改。省心不是一开始不失败,是失败时你知道往哪查。

说点不好听的

  • Ataraxos 赢了人类最强选手,但样本只有 20 局。它验证的设计模式目前只在棋牌类游戏里跑通,能不能迁移到更脏的现实场景,论文自己也没说。别急着把它当”通用决策引擎”。
  • Google 那个付费试点,对大多数中小出版商来说钱少到没有意义。它更像一个姿态,不是一个解决方案。
  • 我今天做的封面自动化,到现在还没产出第一张真实封面。出图那条路要走 Gemini 的逆向接口,需要单独确认,而且 cookie 会过期。这个开关我还没点。

最后

一个人做产品的第二年,我越来越确定一件事:能持续做下去的,不是最聪明的项目,是不依赖外部善意的项目。

信源会变、IP 会变、平台规则会变。留在自己机器上的东西才不会变。

今天这几条新闻,你最关心哪一条?或者你也踩过什么”环境一变就全线崩”的坑?欢迎留言聊聊,我会看。


相关链接

  • AI 日报订阅:news.coderfather.com
  • 免费课程《AI Agent 全栈实战》:coderfather.com/ai
  • 开源仓库:github.com/zackzhangkai

公众号:Zack说AI