跳转到内容

Qwen3.8-Flash-Next

POST /v1/chat/completions model: Qwen3.8-Flash-Next

这里跑的权重是 Qwen3.8-Flash-Next-FP8,即 Qwen3.8-Flash-Next 的 FP8 量化版本,采用块大小 128 的 细粒度 FP8。Qwen 称其指标与未量化的原版几乎一致。

Qwen 把这次发布描述为支撑 Qwen4 的架构的实验性预览,也是该架构下的首个开源权重模型。相对 Qwen3 系列,模型卡列出三处新东西:

  • QSA 混合注意力 —— 原先的 Gated DeltaNet + Gated Attention 组合,改为 Gated DeltaNet + Qwen Sparse Attention(QSA)
  • Gated Residual —— 在带归一化的残差流上再加一道门控,目标是让又深又宽的模型仍然可训。
  • N-gram Embedding —— 一条比 MoE 更省算力、也更容易 offload 的参数扩展轴。

细节见 Qwen 的博客和技术报告。

取自模型卡与随权重发布的 config.json

参数量总计 125B,激活 6B,另有 51B n-gram embedding 与 4B MTP
层数48 层,排布为 12 ×(3 × Gated DeltaNet→MoE,再 1 × QSA→MoE)
隐藏维度2,560
Gated DeltaNet48 个 V 头、16 个 QK 头,头维度 128
Qwen Sparse Attention24 个 Q 头、2 个 KV 头,头维度 256,RoPE 分量 64 维
QSA indexerMQA,4 个 Q 头 + 1 个共享 K 头,头维度 128
QSA 预算512 个块 / 2,048 个 token
专家混合512 个专家,激活 10 个路由 + 1 个共享,专家中间维度 640
N-gram embedding2,000 万个 bigram/trigram,作用在第 2 层
Gated Residual4 个分支,瓶颈秩 320
词表248,320(已 padding)
原生上下文262,144,可外推至 1,000,000
多 token 预测1 层
量化FP8,块大小 [128, 128],激活动态缩放
许可证Qwen Community License 1.0

最值得记住的数字是 QSA 预算:无论对话多长,对 KV cache 的注意力最多只落在 2,048 个被选中的 token 上;而 48 层里有 36 层是线性注意力,其状态大小根本不随上下文增长。

以下全部是对着线上端点实测的。与模型卡不一致的地方以端点为准。

上下文长度262,144 token
输入模态仅文本
流式
工具调用✅(不支持并行调用)
JSON 输出json_object · ❌ json_schema
思考✅ —— 不主动调低就一直在思考
稳定性experimental

不传 reasoning_effort 并不会关掉思考。 普通请求返回的 reasoning 已经有内容、 reasoning_tokens 也非 0。模型内部默认档位是 xhigh,也就是最长的一档。

真正能传进去的只有两档:

档位状态原因
low200
medium200
high400过得了请求校验,但模型拒绝:Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
xhigh422反序列化阶段就被拒——不在端点的枚举里
max422同上
minimal422同上

结果放在哪:

思考文本choices[0].message.reasoning
token 数usage.completion_tokens_details.reasoning_tokens
不提供usage.reasoning_tokens —— 没有顶层字段,和 DeepSeek-V4-Flash 不同
你发的返回
max_tokens 超出窗口400 max_tokens=… cannot be greater than max_model_len=max_total_tokens=262144.
response_format: json_schema400 Model Qwen3.8-Flash-Next does not support JSON schema output mode
content 里带 image_url400 Model Qwen3.8-Flash-Next does not support image input.
thinking: {...}400 —— 请改用 reasoning_effort

max_tokens 是按总预算算的,包含 prompt:262,144 是输入加输出的总和,不是单给输出的额度。

Terminal window
curl https://developer.amd.com.cn/radeon/api/v1/chat/completions \
-H "Authorization: Bearer $RADEON_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen3.8-Flash-Next",
"reasoning_effort": "low",
"messages": [
{ "role": "system", "content": "用一句话回答。" },
{ "role": "user", "content": "天空为什么是蓝的?" }
]
}'

一个 system 消息、放在数组首位、显式传 low——这个请求形状原样打 DeepSeek-V4-Flash 也能通。