MiMo-V2.6-Flash 是 MiMo-V2.6-Pro 的低成本、高吞吐版本:同样支持文本、图像、视频、音频的全模态输入,同样是 100 万 token 上下文与最大 12.8 万 token 输出,但定价面向日常大量调用,而不是最重的推理任务。Glarity 没有把 MiMo 做成内置选项,不过设置面板里的"自定义模型"入口支持任何 OpenAI 兼容的 /chat/completions 端点,小米的 API 正好符合这个形态。整个配置大约五分钟,从设置 → 通用 → 连接 AI 开始。
为什么选 MiMo-V2.6-Flash
如果 MiMo-V2.6-Pro 是旗舰,Flash 就是你每天要总结几十个页面、又不想每次都按旗舰价格付费时的选择。它保留了同样的 100 万 token 上下文和多模态输入,也支持深度思考、工具调用、流式输出、网页搜索、结构化输出和上下文缓存,只是小米把它调优成了更高吞吐、单价只有 Pro 一小部分的版本——对于会在每个页面上被调用的扩展来说,这一点很关键。
开始前需要准备
- 一个从小米 MiMo 控制台获取的 API 密钥
- 下面这些连接参数
Glarity 逐步配置
- 打开 Glarity 扩展,进入设置 → 通用,滚动到"连接 AI 以获得快捷的 Glarity 总结与翻译"区域。
- 将连接类型设为OpenAI API 密钥。
- 把你的小米密钥粘贴到API 密钥字段。
- 将模型设为自定义模型,填入
mimo-v2.6-flash。 - 将模型上下文窗口设为最接近100 万的档位。
- 将API 主机设为
https://api.xiaomimimo.com/v1。 - 将API 路径设为
/chat/completions。 - 温度日常使用设为 0.5(想要更忠实的总结可降到 0.2),点击测试确认收到回复,再点击保存。
设置一览
字段 | 值 | 含义 |
|---|---|---|
连接类型 | OpenAI API 密钥 | MiMo 的 API 采用 OpenAI 对话补全格式 |
API 密钥 | 你的 MiMo 密钥 | 从 MiMo 控制台生成 |
模型 | 自定义模型 → | 官方模型 ID |
模型上下文窗口 | 约 100 万 | MiMo-V2.6-Flash 官方输入上限 |
API 主机 |
| 来自小米官方 API 文档的基础地址 |
API 路径 |
| 标准 OpenAI 兼容路由 |
温度 | 0.5(或 0.2) | 在自然表达与忠实输出之间取平衡 |
定价
根据小米官方定价页面(2026 年 9 月 22 日更新),海外费率为每百万 token:缓存输入 $0.0028、非缓存输入 $0.14、输出 $0.28——大约是 Pro 非缓存费率的三分之一。国内费率为每百万 token ¥0.02 / ¥1 / ¥2。这让 Flash 更适合作为日常页面和视频总结的默认选择,把 Pro 留给真正需要深度推理的任务。新模型费率可能调整,使用前建议核对官方定价页面。
接入 MiMo-Flash 后 Glarity 能做什么
能力 | 目前的表现 |
|---|---|
翻译 | 以更低的单次成本翻译网页文本或选中内容 |
页面总结 | 压缩长文章要点,需要时借助 100 万 token 窗口 |
YouTube 总结 | 总结视频文字稿,包括较长的视频 |
视频字幕 | 根据文字稿生成并翻译字幕文本 |
快捷邮件回复 | 根据选中文本生成简短回复 |
一键提示词 | 用 Flash 而不是默认模型运行你保存的自定义提示词 |
故障排查
- 401 / 未授权错误 —— API 密钥无效或未保存,重新粘贴后点击测试再保存。
- "未找到模型" —— 检查模型 ID 是否精确为
mimo-v2.6-flash。 - 超长输入请求失败 —— Flash 上限是输入 100 万 token / 输出 12.8 万 token。
- 回答难题时感觉不够深入 —— Flash 用推理深度换取速度和成本,如需更深入分析请切换到 MiMo-V2.6-Pro。
- Glarity 仍在用旧模型 —— 只有测试成功并点击保存后设置才会生效。
常见问题
MiMo-V2.6-Flash 是 Glarity 官方支持的模型吗?不是。本教程是通过 Glarity 通用的"自定义模型"设置接入的。
Flash 和 MiMo-V2.6-Pro 有什么区别?两者共享同样的 100 万 token 上下文和多模态输入,但 Flash 针对更高吞吐量调优,单价大约是 Pro 非缓存输入和输出费率的三分之一。
日常总结用 Flash 够用吗?够用。页面和视频总结、翻译、字幕这些场景,Flash 的速度和成本更实用;需要更深推理时再用 Pro。
长期使用成本大概是多少?按非缓存输入每百万 token $0.14、输出每百万 token $0.28 计算,同样用量下成本只是 Pro 的一小部分。
之后能切换到 Pro 或 UltraSpeed 吗?可以,只需把模型字段改成 mimo-v2.6-pro 或 mimo-v2.6-pro-ultraspeed,并按需调整上下文窗口,主机和路径保持不变。
Glarity 编辑部专注于 AI 搜索、视频总结与浏览器效率技巧。
Glarity 是一款免费的浏览器扩展,支持 AI 搜索与 YouTube 视频总结,可在 glarity.app 获取。



