谷歌内部曝光最强数学推理AI模型
「消息源爆料,谷歌正基于DeepThink V3构建内部代号Mathematica的实验AI模型,专攻繁重计算与复杂符号问题求解。API数据显示其内部标识符为models / deepthink-mathematica-tf-raw-thoughts,支持100万词元上下文窗口,输出上限65,536个词元,配置标注为不稳定实验版本并带有内部员工测试标签。」
据消息源爆料,谷歌正在基于 DeepThink V3 模型构建一款内部代号为 Mathematica 的实验性 AI 模型。该模型主要针对繁重计算以及复杂的符号问题求解进行专门优化,预计将成为谷歌目前最强的数学推理 AI 模型。
从 API 数据来看,该模型的内部标识符为“models / deepthink-mathematica-tf-raw-thoughts”,支持高达 100 万个词元(token)的上下文窗口,单次输出上限则为 65,536 个词元。所谓上下文窗口,指模型单次处理时可读取的文本单位总量;输出上限则指模型单次回答可生成的文本单位数量。
值得注意的是,泄露的配置中还标注了“UNSTABLE_EXPERIMENTAL”,这一状态名称表明该版本属于不稳定实验版本。模型同时带有“Teamfood”标签,这是谷歌用于内部员工测试的术语,意味着相关服务目前仍处于内部测试范围,尚未进入面向公众的正式发布阶段。
从能力定位上看,Mathematica 瞄准的是符号计算与高强度推演这类硬核场景。数学推理长期以来被视作衡量大模型能力的重要标尺,因为它要求模型在长链条推导中保持前后一致,任何一步出错都会导致最终结论失效。100 万词元的上下文窗口意味着模型可以一次性容纳极大量的题目描述、中间推导步骤与参考材料,从而在同一个工作区内完成多轮验证与回溯,而不必频繁截断或丢失早期信息。
与此同时,65,536 个词元的输出上限也颇为可观,这为生成完整的证明过程、逐步展开的解题链条以及附带说明的计算结果提供了空间。对于需要反复试错、自我检查的数学任务而言,足够的输出长度往往与推理质量直接相关。
分析指出,谷歌此前已推出面向高阶数学竞赛的 Gemini DeepThink IMO 模式,并在近期上线 Gemini 3.8 Live 和 Live Extended Thinking。Mathematica 的出现,进一步显示出谷歌在数学推理这一方向上的持续投入,也与其在长上下文、深度思考类能力上的整体技术路线相吻合。
不过,实验版本的标记与内部测试标签同样传递出另一层信息:该模型距离正式产品化仍有距离,其性能表现、稳定性以及最终是否会对外开放,都还有待进一步观察。对于关注大模型推理能力的开发者而言,这类内部模型的曝光,往往预示着下一轮公开版本的能力方向。
来源:Heooo AI工具导航