跳转到内容

MiniCPM5-2B

POST /v1/chat/completions model: MiniCPM5-2B

跑的是 openbmb/MiniCPM5-2B,取自随权重发布的 config.json:

架构LlamaForCausalLM,model_type = llama
层数42
隐藏维度2,048
注意力16 个 Q 头、2 个 KV 头(GQA)
中间维度6,144
词表130,560
上下文131,072
精度bfloat16 —— 未量化

本端点上唯一一个稠密(非 MoE)模型,也是唯一一个未量化的模型。上下文 131,072 是这里最短的。

上下文长度131,072 token
输入模态仅文本
流式✅
工具调用✅(见下)
JSON 输出✅ json_object
思考❌
推理引擎vLLM
稳定性experimental

这个模型直接给答案,不返回分离的思考内容:choices[0].message.reasoning 为空, usage.completion_tokens_details.reasoning_tokens 为 0。

答案从 choices[0].message.content 读。需要分离的思考过程时,用 DeepSeek-V4-Flash 或 Qwen3.8-Flash-Next。

system 消息可以放在任意位置,也可以有多条。角色名写 system。

tools 和 parallel_tool_calls 都接受。给它一个 get_weather 工具、问巴黎天气, 模型发出了调用,finish_reason 返回 tool_calls。和任何同等体量的模型一样, 交给它工具驱动的活之前,先用你自己的 prompt 试一试。

上下文窗口131,072 token,prompt 与输出合并计算
JSON 输出response_format: {"type": "json_object"}
输入仅文本