𝗝𝗜𝗣𝗔𝟮𝟯𝟯の小窝 头像

消息来源频道

𝗝𝗜𝗣𝗔𝟮𝟯𝟯の小窝

@jipa233

频道533 位成员公开可见0 人在线

🔗Blog: https://imjipa.top 🔗Donate me: https://imjipa.top/donate 💬Contact me: @jipa233_pmbot

成员规模533 位成员
在线情况0 人在线
消息总数868 条消息
浏览量总数142,617 次浏览

在这个频道里搜索消息……

t.me/jipa233

🚀 小米发布 MiMo-V2 系列:旗舰大模型 + 全模态 + 语音合成三箭齐发
小米 MiMo 团队于 3 月 18 日一口气发布三款新模型:MiMo-V2-Pro(旗舰基座)、MiMo-V2-Omni(全模态)和 MiMo-V2-TTS(语音合成),全面覆盖文本推理、多模态感知与语音表达,标志小米 AI 从「追赶者」迈向全球第一梯队。
📌 MiMo-V2-Pro:Agent 时代的大脑
- 总参数超 1T,激活 42B(Flash 的 3 倍),支持 1M token 上下文
- Artificial Analysis 综合智力指数全球第 8、中国大模型第 2
- 编码能力超越 Claude 4.6 Sonnet,Agent 能力(ClawEval 61.5)接近 Opus 4.6(66.3)
- 此前以匿名代号「Hunter Alpha」上架 OpenRouter,日调用量多次登顶,总用量超 1T tokens
- 定价:输入 $1 / 输出 $3 per 1M tokens(≤256K),仅为 Claude Sonnet 4.6 的 1/3 至 1/5
- 与 OpenClaw、OpenCode、KiloCode、Blackbox、Cline 五大框架合作,提供一周免费 API
📌 MiMo-V2-Omni:看、听、行动,一个模型搞定
- 统一图像、视频、音频编码器,原生全模态感知
- 音频理解超越 Gemini 3 Pro,支持超 10 小时连续音频
- 图像理解超越 Claude Opus 4.6,视频理解具备未来预测能力
- Agent 基准(MM-BrowserComp、OmniGAIA、Claw Eval)超越 Gemini 3 Pro 和 GPT-5.2
- 实测:全自动浏览器购物(小红书选购 → 京东下单 → 客服砍价)、端到端视频制作并上传抖音
- 原生支持结构化工具调用和 UI grounding,可直接接入 Agent 框架
📌 MiMo-V2-TTS:给 Agent 一个有灵魂的声音
- 超 1 亿小时语音数据预训练 + 多维度强化学习
- 自然语言风格指令:用文字描述想要的语气,无需预设标签
- 支持方言(东北话、四川话、粤语等)和角色扮演(孙悟空、林黛玉)
- 细粒度非语言事件:笑声、叹气、咳嗽、犹豫自然融入语音
- 唯一同时支持说话和唱歌的商用 TTS API
- 自动从文本语境推断情感和语气,无需额外标注
🔙 背景
- MiMo-V1(2025年4月):7B 推理模型,性能超越 OpenAI o1-mini,开源但市场反响平淡
- MiMo-V2-Flash(2025年12月):309B/15B MoE 模型,代码能力开源第一,比肩 Claude 4.5 Sonnet,API 定价极低(输入 $0.1/M,输出 $0.3/M)
- 团队由前 DeepSeek 核心成员罗福莉领导,被称为「95后AI天才少女」
⚔️ 竞品对比
- MiMo-V2-Pro vs Claude Opus 4.6:Agent 能力接近但定价远低;编码已超越 Sonnet 4.6
- MiMo-V2-Omni vs Gemini 3 Pro:音频理解和 Agent 基准多项超越
- MiMo-V2-TTS vs 传统 TTS:从「下拉菜单选情绪」到「自然语言描述」的范式转变
🏢 小米 AI 近况
小米 MiMo 团队在短短一年内完成了从 7B 小模型到万亿参数旗舰、从纯文本到全模态的完整跃迁。此次三款模型同时发布,展现出系统性的 AI 战略布局:Pro 负责推理与编码核心,Omni 补全感知与行动闭环,TTS 赋予 Agent 自然语音交互能力。
📎 来源
小米官网 MiMo-V2-Pro:https://mimo.xiaomi.com/mimo-v2-pro
小米官网 MiMo-V2-Omni:https://mimo.xiaomi.com/mimo-v2-omni
小米官网 MiMo-V2-TTS:https://mimo.xiaomi.com/mimo-v2-tts
#小米 #MiMo #AI大模型 #AIAgent #全模态 #TTS #语音合成