这个绰号让人会心一笑:”Le Chonk”。但在它背后,Mistral Large 4 是这家巴黎初创公司迄今推出的最具雄心的模型,它的成绩既亮眼,又有所保留。
核心要点
- Mistral Large 4 在 Artificial Analysis 指数中得分 38,Claude Opus 5.5 为 58。
- 它是中国以外评分最高的开放权重模型,但其权重尚未公布。
- Mistral 并不打算与 OpenAI 和 Anthropic 正面对抗,后两者在 2026 年分别融资 1220 亿美元和 650 亿美元。它出售的是可控性。
- 6 月,法国经济财政部(贝尔西)因 Qwen 在涉华话题上的回答被认为存在倾向,叫停了相关测试。
- 企业面临的问题是:如果美国供应商切断服务,会发生什么?
10 月 6 日,独立评测机构 Artificial Analysis 在其智能指数(4.3.2 版)上给予该模型 38 分。这使它成为 Mistral 所称的”开放权重”模型(即客户可以下载并自行运行其参数的模型)中,中国以外评分最高的一款。
但这一成绩仍是相对的。在同一张图表上,Large 4 在 25 个模型中排名第 18,与 OpenAI 的 GPT-6 Luna 并列。Anthropic 的 Claude Opus 5.5 得分为 58。这是否意味着失败?我认为问题本身提得并不恰当,而答案恰恰揭示了一种影响远超实验室的战略。
这份排名需要谨慎解读
首先要弄清这个数字衡量的是什么。Artificial Analysis 的指数汇总了十项评测:办公类任务、编程、科学推理、知识检索等。该指数修订频繁,评测机构也提醒,不同版本的分数不能相互比较。因此,今天的 38 分与去年的 38 分不可等量齐观。
第二点需要注意:现阶段 Large 4 仍是预览版。Mistral 称其为开放权重模型,但截至撰稿时,这些权重尚未公布。因此 Artificial Analysis 暂时将其归入专有模型。该机构预计,一旦权重发布,它将跻身其网络安全指数中开放模型的前三名。如果 Mistral 继续训练,最终版模型重新接受评测,排名也可能发生变化。
最后是成本。据 Artificial Analysis 统计,运行该指数的一项任务,Large 4 平均需要 1.13 美元,而 Large 3 仅为 0.03 美元。该机构认为,这一成本比智能水平相当的开放模型高出四倍以上。相对 Large 3 提升的 18 分,因此是有代价的。
两场不再在同一量级上展开的竞赛
一个在同类中领先的模型,却在全球榜单上位居中游,这两个事实之所以并存,是因为 Mistral 已不再完全参与其两大美国对手所处的那场竞争。
2026 年,OpenAI 于 3 月完成约 1220 亿美元的融资,估值达 8520 亿美元。Anthropic 于 5 月完成 650 亿美元的 H 轮融资,估值 9650 亿美元。这些资金所支撑的算力和训练规模,是一家同等体量的欧洲企业难以企及的。在预算相当的情况下,试图在前沿模型的主场追赶它们,无异于一场注定失败的豪赌。
Mistral 似乎已得出结论。它的卖点不再是”最好的模型”,而是”你能掌控的最好的模型”:知道它在哪里运行、受哪国法律约束、享有怎样的服务保障,并且无需仰仗第三方的善意就能让它运转。这一主张尤其吸引那些一旦中断就损失惨重的用户:政府部门、银行、工业企业和基础设施运营商。
自建托管并不足够
6 月的贝尔西事件,说明了纯技术思路来理解主权的局限。法国财政部总司在 6 月初向约一百名公务员部署了一款名为 HéphAIstos 的助手,其底层是阿里巴巴的 Qwen 模型。数名用户反映,它在涉华话题上的回答被认为带有倾向。试验于 6 月 23 日叫停,次周周三便换上了 Mistral 的模型,以上信息来自法新社和《世界报》的报道。
贝尔西强调了两点:该助手离线运行,没有互联网连接,也未发现后门;而且这次测试本来就不打算长期进行。该部门由此排除了数据泄露的风险。但关键问题在别处。在自己服务器上运行的模型不会向外传输任何数据,却依然可能在参数中带有训练过程留下的倾向。法新社采访的一位负责任 AI 专家提醒说,偏见是所有模型固有的,但有些偏见可能是刻意植入的。
德国实验室 Aleph Alpha 对 967 个敏感话题展开的一项研究也指向同一方向:受测的中国模型(Qwen、DeepSeek、Kimi)仅有 17% 至 41% 的回答较为均衡。Claude Sonnet 5 达到 70%,Mistral Small 达到 92%。不过,解读这些结果时需格外谨慎,因为 Aleph Alpha 本身就是欧洲的竞争对手,而且它是用自家的自动评估系统来给回答打分的。
押注运行框架、基础设施与法律
同样的逻辑,也解释了一个令人意外的选择。自 8 月起,Mistral 向客户提供 GLM-5.3,这是中国实验室智谱(Z.ai)的开放权重模型,托管在 Mistral 自己的服务器上。9 月 21 日,Mistral 又把它设为编程助手 Vibe Code 网页端的默认选项。据路透社报道,该模型未经修改即对外提供。不过,有工程师在社交媒体上指出,GLM-5.3 与上一版本 GLM-5.2 非常接近,而后者早已在 Mistral 上线。
乍看之下,矛盾十分明显:既要捍卫欧洲的人工智能,又为何分发中国模型?Mistral 的回应是,这款开放模型以及此后的同类模型,将运行在同样的基础设施上,适用与自家模型相同的区域管控和服务承诺。换句话说,这家公司出售的不只是一个模型,而是围绕模型的一整套东西:即”运行框架”(harness),也就是让模型能够在企业环境中使用的工具、防护机制和编排系统,以及托管服务和对欧洲法律的合规。
这一立场并非没有批评者。他们认为这是一种放弃:如果这家初创公司的旗舰模型不再是核心论点,最初的承诺还剩下什么?这个问题并不小,因为 Mistral 的信誉建立在自主训练模型的能力之上。策略的支持者则回应说,这是务实之举:客户选择供应商,看重的不是模型参数的国籍,而是在合同、法律或出口管制发生变化的那一天,自己不会措手不及。
需要记住的数字:
- 38:Mistral Large 4 Preview 在 Artificial Analysis 指数(v4.3.2)上的得分,Claude Opus 5.5 为 58。
- 25 个中排第 18:其在已公布图表中的排名,与 GPT-6 Luna 并列。
- 1.13 美元:运行指数单项任务的平均成本,Large 3 为 0.03 美元。
- 1220 亿美元和 650 亿美元:OpenAI 和 Anthropic 在 2026 年的融资规模。
- 6 月 23 日:财政部总司叫停 Qwen 测试的日期。
- 超过 100 万名公务员:”Notre IA”计划的目标群体,由 Mistral 驱动的助手,初始预算 70 万欧元。
企业高管、信息主管与公共采购方面临的问题
于是,这套推理向每一个组织抛出了同一个问题:如果您的美国供应商明天切断服务,贵公司有什么会停摆?
这并非抽象的假设。6 月,Anthropic 为遵守美国商务部制定的出口管制,暂停了其两款最先进模型的访问,并在管制解除后于 7 月 1 日恢复。这一事件虽只持续了几周,却提醒人们:通过 API 调用的模型,仍受制于客户公司之外作出的决定。这一点同样适用于目前基于美国模型构建工具的摩洛哥和非洲组织。
对此,可以有三条思路。其一,梳理依赖外部模型的业务流程,因为并非所有流程都至关重要。其二,准备备用模型,哪怕性能较弱,只要能保证最低限度的服务。其三,要求供应商在托管、适用司法管辖区以及模型对敏感话题的表现上保持透明。
主权仍有待验证
如果就此断言 Mistral 的战略已经成功,未免草率。旗舰模型仍处于中游,运行成本高昂。最终版本及其许可条款尚不明朗。与公共部门的合同表明国家对其有信心,但仍有待大规模使用的检验。
真正的疑问在于:可控性是一个可持续的商业论点,还是一旦美国模型某天提供类似保障就会消失的优势?在此之前,企业需要做出一个既不取决于排名,也不取决于绰号的决定:选择愿意把什么委托出去,又委托给谁。
常见问题
Mistral Large 4 真的是开放模型吗?
Mistral 是这样宣称的,但截至撰稿时其权重尚未公布。因此 Artificial Analysis 暂时将其归为专有模型。
Mistral 为什么提供中国模型?
因为它的商业论点围绕基础设施、区域管控和欧洲法律框架,而非模型的出处。该公司称,对 GLM-5.3 适用与自家模型相同的服务承诺。
贝尔西与 Qwen 之间发生了什么?
6 月 23 日,财政部总司叫停了基于 Qwen 的助手 HéphAIstos 的测试,原因是有人反映其在涉华话题上的回答被认为存在倾向。贝尔西强调,该工具是离线运行的。
这对企业意味着什么?
它提示企业梳理自身对 AI 供应商的依赖,准备备用模型,并要求托管和模型表现方面的透明度。