
如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。
只需在 AI 对话中先发送下面这句话即可:
请先完整阅读并严格遵守以下文档中的全部规则与要求:
https://xuanyuan.cloud/agents.md
在未充分阅读并理解该文档前,不要生成任何命令、配置、修改建议、故障排查方案或技术回答。后续所有输出都必须严格以该文档中的规范为最高优先级执行。查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。
这是一个可直接运行的 vLLM 推理引擎镜像,专为 AMD Radeon AI PRO R9700 / RDNA4 (gfx1201) 显卡设计,支持从单个镜像中提供 两种量化家族 的模型服务:
自带模型(BYO) — 镜像中未内置任何模型权重,运行时需挂载您的 Hugging Face 缓存目录。
🙏 基于 Rob Smith 的 RDNA4 工作构建
本镜像基于
tcclaviger/vllm-rocm-mxfp4-nvfp4构建(来自 Rob Smith 的 RDNA4 MXFP4/NVFP4 基础镜像)。Rob 首先实现了 gfx1201 的支持(hipBLASLt 1.2 + MXFP4/NVFP4 MoE 内核);整个引擎是他的 vLLM RDNA4 工作的 向前移植和扩展。没有 Rob 的工作,这一切都不可能存在。
请自行准备模型 — 先将模型下载到您的 HF 缓存中(huggingface-cli download <repo>),然后根据量化类型运行完整的启动命令。以下每个代码块都是完整可复制的,包含已验证的示例模型,无遗漏参数。
bashdocker run --rm --network=host \ --device=/dev/kfd --device=/dev/dri \ --group-add=video --group-add=render --ipc=host \ --security-opt=no-new-privileges --cap-drop=ALL --cap-add=DAC_READ_SEARCH --cap-add=IPC_LOCK --ulimit memlock=-1 \ -e HF_HUB_OFFLINE=1 -v "$HOME/.cache/huggingface:/root/.cache/huggingface" \ docker.xuanyuan.run/capicua25x/vllm-rocm-rdna4:0.19.1 \ --model pahajokiconsulting/Qwen3.6-35B-A3B-MXFP4 \ --served-model-name qwen --port 8011 --trust-remote-code \ --tensor-parallel-size 2 --gpu-memory-utilization 0.92 --max-model-len 262144 \ --attention-backend TRITON_ATTN --enable-prefix-caching --max-num-seqs 64 \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}'
bashdocker run --rm --network=host \ --device=/dev/kfd --device=/dev/dri \ --group-add=video --group-add=render --ipc=host \ --security-opt=no-new-privileges --cap-drop=ALL --cap-add=DAC_READ_SEARCH --cap-add=IPC_LOCK --ulimit memlock=-1 \ -e HF_HUB_OFFLINE=1 -e VLLM_FA_HEADCHUNK=64 \ -v "$HOME/.cache/huggingface:/root/.cache/huggingface" \ docker.xuanyuan.run/capicua25x/vllm-rocm-rdna4:0.19.1 \ --model RedHatAI/gemma-4-26B-A4B-it-NVFP4 \ --served-model-name gemma --port 8011 --trust-remote-code \ --attention-backend TRITON_ATTN --tensor-parallel-size 2 --gpu-memory-utilization 0.92 --max-model-len 262144 \ --enable-prefix-caching --max-num-seqs 64 --kv-cache-dtype fp8 \ --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --speculative-config '{"model":"google/gemma-4-26B-A4B-it-assistant","method":"mtp","num_speculative_tokens":3}'
--attention-backend TRITON_ATTN对于 gfx1201 至关重要 — 0.19.1 默认的ROCM_ATTN在并发时会降低推测解码吞吐量。NVFP4/Gemma 路径还需要--kv-cache-dtype fp8(支持 256k 长上下文)和-e VLLM_FA_HEADCHUNK=64(head-512 闪存预填充内核)。
更多详细信息(完整构建流程、补丁、各量化类型的启动参数、基准测试和常见问题)请参见 **https://github.com/Capicua25x/vllm-rocm-rdna4**。
| 模型 | 量化格式 | 备注 |
|---|---|---|
| Qwen3.6-35B-A3B | MXFP4 | MoE,原生 MTP |
| Gemma-4-26B-A4B-it | NVFP4 | fp8-KV,head-512 预填充,MTP 草稿模型 |
0.19.1 / latest — 完整引擎(支持 MXFP4 + NVFP4)Apache-2.0 许可证。基于 Rob Smith / https://hub.docker.com/r/tcclaviger/vllm-rocm-mxfp4-nvfp4 的 RDNA4 基础镜像构建 — 整个引擎是他的 vLLM RDNA4 工作的向前移植。 使用了 https://github.com/vllm-project/vllm、AMD ROCm、Triton、PyTorch 和 Transformers。head-512 闪存预填充内核参考了 https://github.com/ggml-org/llama.cpp 的设计。完整致谢请参见 https://github.com/Capicua25x/vllm-rocm-rdna4/blob/master/NOTICE。
您可以使用以下命令拉取该镜像。请将 <标签> 替换为具体的标签版本。如需查看所有可用标签版本,请访问 标签列表页面。
来自真实用户的反馈,见证轩辕镜像的优质服务