更多文章

AI 与开发者相关深度内容

小红书 dots.note-3.0 拿下 IMO 满分:全球首个数学奥赛满分模型诞生

Last checked: 2026-07-23

小红书大模型团队的 dots.note-3.0 被报道在 2026 年国际数学奥林匹克竞赛(IMO)六道题上得到 42/42 分。这个结果值得关注,因为它把前沿模型的数学能力从“答对若干短题”推进到需要连续定义、构造、证明和自检的奥赛题。但标题中的“拿下 IMO 满分”必须按正确口径理解:模型是在赛题公布后接受评测,不是作为人类选手进入正式考场;42 分来自对六份解答的评分,不等于模型拥有一张由 IMO 颁发的参赛证书。

China Daily 的具名报道South China Morning Post 的报道都把它描述为首个在这一组 IMO 题目评测中取得无瑕疵分数的 AI 模型。本文沿用这个有边界的“首个”口径,不把它扩展成所有数学基准、所有年份或所有评测设置下的绝对世界第一。

dots.note-3.0 满分结果页面

图片将保存报道所依据的结果页面,访问日期 2026-07-23。它能证明公开页面如何陈述 42/42,不能证明每次推理的隐藏轨迹、工具调用或重试次数。

42/42 到底意味着什么

IMO 一般有六道题,每题最高 7 分,总分 42 分。正式比赛分两天进行,每天四个半小时,选手不能联网。对模型的赛后评测需要另外定义提示词、工具权限、采样次数、答案选择方式和评分人。如果其中任一项变化,结果的可比性都会变化。IMO 官方题目档案提供题目与解答入口,2026 年官方结果页则用于核对人类比赛的年份、分数线和选手结果;两者都不会自动认证某个商业模型的赛后测试。

核对项 当前可支持的结论 不能从中推出什么 采用决策
题目范围 报道指向当年六道 IMO 题 不是长期数学能力全量测试 可以进入复跑
分数 报道为 42/42 不代表每个采样都满分 要求原始答案与逐题评分
“首个” 限于公开报道采用的同组题评测定义 不代表所有模型、所有私测都被穷尽 标题保留,正文紧邻限定
工具与网络 公开材料尚不足以完整复原 不能假设完全无工具 未披露就暂停独立认证
模型可用性 名称为 dots.note-3.0 不等于已有公开 API、权重或模型卡 不写调用教程或价格

这张表也是最重要的阅读方法:先问结果是哪一层证据,再问它能否支持采购或研究决策。42/42 是强结果信号,但从“新闻级结果”到“可复现能力”还隔着一套评测包。

2026 IMO 六道题与官方资料入口

图片来源于 IMO 官方题目档案,访问日期 2026-07-23。它证明题目集的官方出处,不证明 dots.note-3.0 使用了哪一版题面、翻译或提示。

六题证据应该怎样逐项保存

真正有用的证据表不是只写六个“7”,而是每题保存五层材料:原始题面、模型收到的完整提示、模型最终提交、评分意见、执行元数据。题面要保留语言、公式编码和附件;提示要说明是否要求只给证明、是否提供官方定义、是否允许自我修正;执行元数据至少包含模型标识、时间、temperature、seed(若可用)、最大输出、超时和工具清单。

每题的评分也应拆成“主要构造是否正确、关键引理是否证明、边界条件是否覆盖、结论是否从前文推出”。奥赛证明可能在核心思路正确时得到部分分,也可能因为一个未证明的跳步丢分。仅让另一个语言模型返回“正确”会把文风流畅误当成数学严谨。至少需要两位能读懂该题的独立评审,并保存他们第一次判断,发生分歧后再进入仲裁。

对第 1 到第 6 题,推荐表格字段固定为:problem_idprompt_hashrun_idattempt_notool_loganswer_hashgrader_a_scoregrader_b_scoreadjudicated_scorefailure_note。这样才能判断满分来自一次稳定输出,还是许多候选中人工挑出最好答案。后者也可以有研究价值,但不能和一次提交制混写。

“全球首个”需要紧邻范围说明

报道中的“first AI model”是一个可引用的新闻结论,成立范围是已被这些报道比较的模型及其 2026 IMO 六题评测。它不应被改写为“第一个达到人类金牌数学水平的系统”,因为人类比赛同时约束时间、信息、交互和一次性提交。也不能据此声称模型在代数、几何、组合、数论之外的大学数学或研究数学上同样稳定。

另一个边界是时间。过去模型可能在不同年份题目、不同工具条件下取得满分或接近满分;“首个”的竞争对象必须共享题集和评测定义。本文没有找到可供下载的 dots.note-3.0 checkpoint、公开 API 定价页、正式模型卡或包含完整运行轨迹的复现仓库,因此不会虚构这些入口。若团队随后发布材料,应按发布日期更新,而不是倒推今天已经存在。

具名媒体对满分与首个口径的报道

图片来源于具名媒体报道页面,访问日期 2026-07-23。它证明媒体采用了“满分”和“首个”的表述,不是独立运行日志,也不证明模型已经公开。

复现缺口比排行榜位置更重要

当前缺口可以分成四类。第一是输入缺口:题面语言、提示模板、系统指令是否公开。第二是执行缺口:是否联网、是否用代码或搜索、每题生成几次、谁选择最终答案。第三是评分缺口:评分人身份、评分 rubric、分歧处理和逐题批注。第四是模型缺口:准确版本、推理预算、上下文限制以及运行服务是否冻结。

这些缺口不会自动推翻结果,却决定第三方能复现到哪一步。团队可以把报道结果标为 reported,把可下载答案且可重新评分的结果升为 auditable,把固定模型、固定提示、固定运行容器的重复结果升为 reproducible。在完整材料出现前,RadarAI 的结论停在“强、值得复跑的报道结果”,而不是“已经独立认证”。

六道奥赛题复跑:双评审与固定重试预算

一家做数学推理评测的团队准备一个六题任务包。输入是 IMO 官方英文题面及经复核的中文题面,所有公式转为同一 LaTeX 编码。执行容器断网,模型只能输出文本,不开放 Python、搜索或外部定理库。每道题使用同一系统提示,限时 90 分钟,最大 32,000 输出 tokens;首次提交后只允许一次由固定字符串触发的“检查并修正”重试,不能由研究员临场追问。

两个评审在看不到模型名称和彼此分数的情况下按 0 至 7 分评分。若相差超过 1 分,由第三人只依据预先写好的 rubric 仲裁。团队保存全部失败样本,包括空答案、超过预算、引用不存在定理、结论正确但关键步骤缺失,以及因排版无法确定等号关系的答案。通过门槛是六题仲裁总分恰为 42,且两位初评在至少五题上完全一致;重跑三次时不得靠增加重试预算维持满分。

暂停信号有三类:运行记录缺少一次候选、两个评审对核心正确性有争议、容器日志出现未声明工具或网络请求。任何一项发生,就只能报告逐题结果,不能宣布“复现满分”。这个任务包的价值不是替厂商做宣传,而是把一个抢眼数字转为可检查、可失败的实验。

复跑报告还应公开失败分布,而不是只给最高总分。逐题列出首次得分、修正后得分、两位评审分差、超时和无效证明数量,可以判断能力来自稳定推理还是重试筛选。若某一道题三次运行分别得到 7、2、0 分,即使最高一轮总分为 42,也应把稳定性风险放在摘要里。团队还要保存没有进入最终答案的候选,因为这些材料最能暴露虚构引理、循环论证、漏掉边界条件和答案选择偏差。只有成功样本而没有失败样本的评测,不能支持生产可靠性判断。

局限与采用建议

六题样本很小,而且同一届题目可能迅速进入公开语料。复跑越晚,越难排除训练或检索污染。即使严格复现 42 分,也只说明模型在固定设置下能解决这六题,不保证面对新题、交互式证明、形式化验证或低预算调用时同样可靠。

产品团队现在最合理的动作是观察并索取评测包;研究团队可以用自有模型跑同一协议;普通开发者不应根据报道预订一个尚无公开入口的 API。需要系统评估基准结果时,可继续阅读 Benchmark 分数怎么看:MMLU、AIME、MATH-500 对团队选型意味着什么,把排行榜证据和自己的交付门槛分开。

常见问题 FAQ

dots.note-3.0 真的参加了 IMO 吗?

不是以人类选手身份参加正式考场。准确说法是模型针对 IMO 六道题接受了赛后评测,并被报道得到 42/42。

42/42 是否等于每次运行都满分?

不等于。要回答稳定性,必须知道采样数、重试数、候选选择和逐次答案。当前公开报道支持结果快照,不足以支持每次运行都满分。

“全球首个”是否可以直接引用?

可以在标题和正文中引用,但应紧邻说明它限于报道采用的同组题目与评测定义,不能扩展为所有数学任务的绝对第一。

现在能下载或调用 dots.note-3.0 吗?

截至 2026-07-23,本文核查材料中没有足够证据支持公开 checkpoint、稳定 API、价格或完整模型卡,因此不提供虚构的调用步骤。

最小复现条件是什么?

固定六题、提示、网络和工具权限、推理预算、重试预算及答案提取规则;保存完整轨迹;至少两位独立数学评审;预先定义分歧和暂停条件。

来源 Sources

← 返回更多文章