🐱 Mistral 开源了 Mistral 3 系列模型
Mistral 3 包含三个小型密集模型(14B、8B、3B)和 Mistral Large 3——Mistral 迄今为止最强大的模型,采用稀疏混合专家架构,41B 活跃参数和 675B 总参数。所有模型均采用 Apache 2.0 许可证开源。
🆕 核心亮点
🔹 Mistral Large 3: LMArena 开源非推理模型排行榜第 2 名,整体开源模型第 6 名
🔹 在 3000 张 NVIDIA H200 GPU 上从头训练,支持图像理解和多语言对话
🔹 Ministral 3 系列: 同类最佳性价比,提供 3B/8B/14B 三种规格
🔹 每个规格提供 base、instruct、reasoning 三个变体,均支持多模态
🔹 Ministral 14B reasoning 在 AIME '25 上达到 85% 准确率
🔹 优化部署: 支持 NVFP4 格式,可在单个 8×A100/H100 节点运行 Large 3
🔑 关键词:
开源前沿模型, 混合专家架构, 多模态, 边缘部署, 最佳性价比
📄 技术报告
🤗 HuggingFace: Large 3 & Ministral 3
🏄♂️ 立即体验
🔌 API 访问和定价
Mistral 3 包含三个小型密集模型(14B、8B、3B)和 Mistral Large 3——Mistral 迄今为止最强大的模型,采用稀疏混合专家架构,41B 活跃参数和 675B 总参数。所有模型均采用 Apache 2.0 许可证开源。
🆕 核心亮点
🔹 Mistral Large 3: LMArena 开源非推理模型排行榜第 2 名,整体开源模型第 6 名
🔹 在 3000 张 NVIDIA H200 GPU 上从头训练,支持图像理解和多语言对话
🔹 Ministral 3 系列: 同类最佳性价比,提供 3B/8B/14B 三种规格
🔹 每个规格提供 base、instruct、reasoning 三个变体,均支持多模态
🔹 Ministral 14B reasoning 在 AIME '25 上达到 85% 准确率
🔹 优化部署: 支持 NVFP4 格式,可在单个 8×A100/H100 节点运行 Large 3
🔑 关键词:
开源前沿模型, 混合专家架构, 多模态, 边缘部署, 最佳性价比
📄 技术报告
🤗 HuggingFace: Large 3 & Ministral 3
🏄♂️ 立即体验
🔌 API 访问和定价