前 OpenAI 首席技术官米拉·穆拉蒂创办的 Thinking Machines Lab,已发布首个多模态模型 Inkling。该模型从零训练完成,全部权重已在 Hugging Face 公开,采用 Apache 2.0 许可,并已接入公司云平台 Tinker 供开发者微调。
模型规模接近万亿参数
Inkling 采用混合专家架构,总参数量为 9750 亿,每次任务激活约 410 亿参数。模型支持文本、图像和音频输入,上下文窗口为 100 万 token,预训练数据规模为 45 万亿 token,覆盖文本、图像、音频和视频。
这也是穆拉蒂离开 OpenAI 后推出的首个模型产品。她于 2024 年 9 月离职,并在 2025 年 2 月创办 Thinking Machines Lab。该公司在 2025 年 7 月完成 20 亿美元融资,估值达 120 亿美元,随后一度寻求按 500 亿美元估值继续融资,但谈判在 2026 年初破裂。
代理任务表现领先西方同类
从已披露测试结果看,Inkling 的优势主要集中在代理型任务。在 MCP Atlas 测试中,Inkling 得分 74.1%,较 Nvidia 的 Nemotron 3 Ultra 高近 30 个百分点;在 SWE-Bench Verified 中,Inkling 得分 77.6%,也高于后者的 70.7%。
- MCP Atlas 得分 74.1%
- SWE-Bench Verified 得分 77.6%
- 全部权重已开放下载
MCP Atlas 主要衡量模型通过外部工具完成真实任务的稳定性,SWE-Bench Verified 则用于测试模型能否自主修复 GitHub 上的真实软件缺陷。Thinking Machines Lab 将 Inkling 定位为通用型模型,而非只针对单一任务优化。
中国模型仍在部分基准领先
不过,Inkling 并非当前整体表现最强的模型。按文中对比,Z.ai 的 GLM 5.2 在 Terminal Bench 2.1 上得分 82.7%,高于 Inkling 的 63.8%;Kimi K2.6 则在 Humanity's Last Exam 这类高难度科学推理测试中保持领先。
在安全性测试 FORTRESS Adversarial 中,Inkling 得分 78.0%,是对比样本中表现最好的开源权重模型之一。Thinking Machines Lab 还预告了更小版本 Inkling-Small,总参数量为 2760 亿、激活参数 120 亿。公司称,该版本在多数推理测试中已接近大模型表现,但尚未公布权重发布时间。
