首页  >  快讯 >  精选快讯 >  同一批模型,换一把尺子量 → 中美 AI 差距从 1 个多月变成
 07月21日 星期二
09:56
同一批模型,换一把尺子量 → 中美 AI 差距从 1 个多月变成

独立分析者 Lisan al Gaib 把「中国追上了吗」拆成一道能算的题,一页带图讲完两把尺子为什么给出相反答案。

01

这研究在问什么 · 榜单答不了的那一半

7 月 16 日月之暗面发布 2.8 万亿参数的 Kimi K3,「中国追平美国」的说法四起。它的成绩单确实硬:自评的 35 项里 30 项赢过 Claude Opus 4.8,前端代码竞技场 1679 分排第一。但这句话到底能撑住多少,取决于那 35 项是怎么挑出来的。

✔ 这批成绩能证明的:Kimi K3 写代码这一项,和当下美国最强模型打得有来有回。

✘ 这批成绩证明不了的:它整体到底落后多久。

因为选了哪些题,就决定了结论。35 项里 24 项是看图和跑任务这两类,占了近七成;长上下文一项没有,网络与生化等安全类一项没有,正经数学几乎没有,答一道题要烧多少字(token 效率,也就是花多少算力)同样一项没有。缺席的比在场的更说明问题

发现了什么 · 两把尺子,两个相反答案

把同一批模型、同一段时间,分别放进两套评测体系里量,出来的不只是数字不同,方向也反了。

....

余下部分看链接

举报
币  海  财  经  社  区 轻财经,投资更简单、轻松

圈子热点消息


广告