跳转到内容

MiMo-V2.6-Flash

POST /v1/chat/completions model: MiMo-V2.6-Flash

这里提供的权重是 MiMo-V2.6-Flash,小米 MiMo-V2.6 系列里侧重效率的那一档 —— 一个稀疏 MoE 模型,在同一个端点上接受文本、图像、视频和音频,并且默认先思考再回答。

取自随权重发布的 config.json:

架构MiMoV2ForCausalLM,model_type = mimo_v2
参数量总计 309B,每 token 激活 15B
层数48 —— 39 层滑动窗口 + 9 层全局;第一个 block 是全局注意力配稠密 FFN,其余 47 层是 MoE
隐藏维度4,096
注意力64 个 query 头;全局层 4 个 KV 头,滑窗层 8 个
头维度Q/K 为 192,V 为 128 —— 非对称
滑动窗口128 token
专家混合256 个路由专家,每 token 激活 8 个,专家中间维度 2,048,无共享专家
多 token 预测config.json 声明 3 层;随权重发布的 dflash/ 草稿模型是 5 层
词表152,576
原生上下文1,048,576
量化quant_method: fp8 e4m3,块 [128, 128],以 MXFP4 存储(store_dtype: mxfp4,块 32)
许可证MIT

视觉塔是 681M 参数的 MiMo ViT(28 层,24 层滑窗 + 4 层全局,patch 16,空间合并 2×2)。 音频走 308M 的 AudioTokenizer 加 127M 的 patch 编码器。

上下文长度1,048,576 token
输入模态文本、图像、音频
流式✅
工具调用✅
JSON 输出✅ json_object 和 json_schema
思考✅ —— 默认开启,需要显式关闭
推理引擎SGLang
稳定性experimental

这是本 API 上唯一接受音频的模型,也是唯一接受严格 json_schema(而不只是 json_object)的模型。

system 消息可以出现在任意位置,也可以有多条。

思考默认开启。完全不传 reasoning_effort,响应里依然带有内容的 reasoning:

"message": {
"role": "assistant",
"content": "4",
"reasoning": "2+2 is 4."
}

要关掉,传 reasoning_effort: "none",此时 reasoning 返回空。

图像通过 image_url 部件传入,支持 base64 data URL:

{
"role": "user",
"content": [
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,..." } },
{ "type": "text", "text": "图中有几个蓝色圆形?" }
]
}

usage.prompt_tokens_details.image_tokens 会报告图像的消耗 —— 一张 1200×420 的 PNG 计为 494 个 image token。

音频使用 OpenAI 的 input_audio 部件:

{
"role": "user",
"content": [
{ "type": "input_audio", "input_audio": { "data": "<base64>", "format": "wav" } },
{ "type": "text", "text": "这是什么声音?" }
]
}

音频前端会重采样到 24 kHz。本 API 上没有其它模型接受这个部件类型。

两种形式都可用:

response_format结果
{"type": "json_object"}✅ {"北京": 2174, "上海": 2487}
{"type": "json_schema", "json_schema": {..., "strict": true}}✅ {"city":"北京","pop":2174}
上下文窗口1,048,576 token,按总预算计 —— 提示词加输出
输入文本、图像、音频
JSON 输出json_object 与严格 json_schema
思考档位reasoning_effort —— 传 none 关闭;其它档位会被接受,但本模型没有像 DeepSeek 系列那样按档位标定
Terminal window
curl https://developer.amd.com.cn/radeon/api/v1/chat/completions \
-H "Authorization: Bearer $RADEON_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiMo-V2.6-Flash",
"messages": [
{ "role": "user", "content": "天空为什么是蓝色的?" }
]
}'

加上 "reasoning_effort": "none" 即可只要答案、不要思考过程。