MiMo-V2.6-Flash
POST
/v1/chat/completions
model:
MiMo-V2.6-Flash
关于这个模型
Section titled “关于这个模型”这里提供的权重是 MiMo-V2.6-Flash,小米 MiMo-V2.6 系列里侧重效率的那一档 —— 一个稀疏 MoE 模型,在同一个端点上接受文本、图像、视频和音频,并且默认先思考再回答。
取自随权重发布的 config.json:
| 架构 | MiMoV2ForCausalLM,model_type = mimo_v2 |
| 参数量 | 总计 309B,每 token 激活 15B |
| 层数 | 48 —— 39 层滑动窗口 + 9 层全局;第一个 block 是全局注意力配稠密 FFN,其余 47 层是 MoE |
| 隐藏维度 | 4,096 |
| 注意力 | 64 个 query 头;全局层 4 个 KV 头,滑窗层 8 个 |
| 头维度 | Q/K 为 192,V 为 128 —— 非对称 |
| 滑动窗口 | 128 token |
| 专家混合 | 256 个路由专家,每 token 激活 8 个,专家中间维度 2,048,无共享专家 |
| 多 token 预测 | config.json 声明 3 层;随权重发布的 dflash/ 草稿模型是 5 层 |
| 词表 | 152,576 |
| 原生上下文 | 1,048,576 |
| 量化 | quant_method: fp8 e4m3,块 [128, 128],以 MXFP4 存储(store_dtype: mxfp4,块 32) |
| 许可证 | MIT |
视觉塔是 681M 参数的 MiMo ViT(28 层,24 层滑窗 + 4 层全局,patch 16,空间合并 2×2)。 音频走 308M 的 AudioTokenizer 加 127M 的 patch 编码器。
这个端点的行为
Section titled “这个端点的行为”| 上下文长度 | 1,048,576 token |
| 输入模态 | 文本、图像、音频 |
| 流式 | ✅ |
| 工具调用 | ✅ |
| JSON 输出 | ✅ json_object 和 json_schema |
| 思考 | ✅ —— 默认开启,需要显式关闭 |
| 推理引擎 | SGLang |
| 稳定性 | experimental |
这是本 API 上唯一接受音频的模型,也是唯一接受严格 json_schema(而不只是 json_object)的模型。
messages
Section titled “messages”system 消息可以出现在任意位置,也可以有多条。
思考默认开启。完全不传 reasoning_effort,响应里依然带有内容的 reasoning:
"message": { "role": "assistant", "content": "4", "reasoning": "2+2 is 4."}要关掉,传 reasoning_effort: "none",此时 reasoning 返回空。
图像通过 image_url 部件传入,支持 base64 data URL:
{ "role": "user", "content": [ { "type": "image_url", "image_url": { "url": "data:image/png;base64,..." } }, { "type": "text", "text": "图中有几个蓝色圆形?" } ]}usage.prompt_tokens_details.image_tokens 会报告图像的消耗 ——
一张 1200×420 的 PNG 计为 494 个 image token。
音频使用 OpenAI 的 input_audio 部件:
{ "role": "user", "content": [ { "type": "input_audio", "input_audio": { "data": "<base64>", "format": "wav" } }, { "type": "text", "text": "这是什么声音?" } ]}音频前端会重采样到 24 kHz。本 API 上没有其它模型接受这个部件类型。
两种形式都可用:
response_format | 结果 |
|---|---|
{"type": "json_object"} | ✅ {"北京": 2174, "上海": 2487} |
{"type": "json_schema", "json_schema": {..., "strict": true}} | ✅ {"city":"北京","pop":2174} |
| 上下文窗口 | 1,048,576 token,按总预算计 —— 提示词加输出 |
| 输入 | 文本、图像、音频 |
| JSON 输出 | json_object 与严格 json_schema |
| 思考档位 | reasoning_effort —— 传 none 关闭;其它档位会被接受,但本模型没有像 DeepSeek 系列那样按档位标定 |
curl https://developer.amd.com.cn/radeon/api/v1/chat/completions \ -H "Authorization: Bearer $RADEON_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "MiMo-V2.6-Flash", "messages": [ { "role": "user", "content": "天空为什么是蓝色的?" } ] }'加上 "reasoning_effort": "none" 即可只要答案、不要思考过程。