Mistral发布万亿参数多模态模型ML4 封面图
技术进展

Mistral发布万亿参数多模态模型ML4

Heooo 10月06日23时01分 3 阅读

「Mistral AI推出新一代旗舰大模型Mistral Large 4,参数量达一万亿,昵称Le Chonk,支持多模态能力。该模型当前仅通过带护栏的公共端点开放访问,权重计划在约三周后完成安全测试再行释放。训练全程依托自建算力,仅使用4000块NVIDIA GPU,重点优化网络安全、金融与芯片设计等场景。」

Mistral AI 正式发布新一代旗舰大模型 Mistral Large 4,简称 ML4。这是一款参数量达到一万亿的大型多模态模型,内部昵称 Le Chonk,取自其庞大的体量。与许多只开放 API 的闭源模型不同,也与直接放出权重的开放模型不同,ML4 选择了一条居中的路线:先以受控方式开放服务能力,再逐步释放模型权重。

从技术定位来看,ML4 被 Mistral AI 视为兼具开放生态灵活性与前沿模型能力的产品。它的目标并不只是做一个可调用的推理服务,而是希望在开放权重模型这一赛道中做到最好,同时在部分对客户至关重要的细分领域具备与闭源模型正面竞争的实力。Mistral AI 科学与技术副总裁 Pierre Stock 表示,借助更有针对性的训练策略,ML4 有望在特定任务上超越闭源对手,尤其是在多模态能力能够真正带来增量的场景中。

Mistral发布万亿参数多模态模型ML4

在开放节奏上,ML4 目前并不是一款开放权重模型。现阶段用户只能通过带有安全护栏的公共端点访问它。Mistral AI 的计划是在大约三周之后、安全测试完成之时,将模型权重正式放出。这种先测试、后开放的做法,反映出团队对企业与机构客户核心关切的回应:权重一旦释放便无法收回,因此需要在开放之前尽可能把风险边界厘清。同时,Mistral AI 也强调开放权重本身带来的好处,即模型更容易被外部审计与验证,这对需要透明度的客户群体尤为重要。

训练效率是 ML4 另一个值得关注的技术细节。据 Pierre Stock 介绍,ML4 完全在 Mistral 自有的算力上完成训练,整个过程只动用了 4000 块 NVIDIA GPU,这一规模比同类竞争者少了两到三倍,也显著低于闭源阵营的投入水平。在算力资源越来越成为大模型竞争核心变量的当下,用更少的硬件堆叠换取万亿参数级别的模型能力,本身就是一种工程与训练方法上的取舍结果,也从侧面说明数据配比、训练流程与架构优化在其中扮演了关键角色。

Mistral发布万亿参数多模态模型ML4

在具体用例上,ML4 的优化方向包括网络安全与金融,此外还覆盖芯片设计。芯片设计之所以被列入核心场景,与其背后投资方的业务结构直接相关:荷兰设备巨头 ASML 领投了 Mistral AI 的 C 轮融资,三星则在上个月领投了 D 轮融资,该轮融资对公司的估值达到 210 亿欧元,约合 243.9 亿美元。对于这两家投资方而言,芯片设计与制造环节恰好是多模态模型可能产生实际价值的领域。

不过,ML4 目前尚未公布基准测试结果。Mistral AI 表示,希望 ML4 能够成为开放权重模型中的最佳选择,并且这一目标并不局限于某一地区市场。能否兑现这一承诺,最终仍要等评测数据公开后才能判断。与此同时,公司也在回应外界对其定位的疑问:此前托管其他模型的做法并不意味着 Mistral AI 要转型为单纯的推理服务提供商,随着 Le Chonk 的推出,公司认为自己依然应当被视为一家前沿实验室。

整体来看,ML4 的意义在于它把几个当下最受关注的议题压缩到了同一个产品里:万亿参数规模、多模态能力、受限开放到权重释放的渐进路径、极致的算力效率,以及面向企业与机构的安全考量。在开放与闭源两条路线持续分化的背景下,Mistral AI 试图用一款自研旗舰模型证明,中间路线并非妥协,而是一种可以同时兼顾能力、可控性与开放性的工程选择。接下来三周的安全测试结果与后续权重释放情况,将成为观察这一路线能否成立的关键节点。

# Mistral AI # 多模态模型 # 开放权重 # 万亿参数

来源:Heooo AI工具导航