如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。
只需在 AI 对话中先发送下面这句话即可:
请先完整阅读并严格遵守以下文档中的全部规则与要求:
https://xuanyuan.cloud/agents.md
在未充分阅读并理解该文档前,不要生成任何命令、配置、修改建议、故障排查方案或技术回答。后续所有输出都必须严格以该文档中的规范为最高优先级执行。查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。
面向异构机器和消费级GPU的推测式推理。自定义内核、推测式预填充和解码,针对每个模型和硬件目标进行优化。
| 优化项 | 测试配置 | 结果 |
|---|---|---|
| DFlash2 | 单张R9700上的Qwen 3.8 27B | 平均208.1 tok/s,峰值227.8 tok/s |
| DSpark | Strix Halo上的DeepSeek V4,原生top-6 | 高接受度中位数32.7 tok/s;混合评估平均27.9 tok/s |
| PFlash + KVFlash | RTX 3090上256K上下文的Laguna XS 2.1 33B | 预填充6.1×,耗时从411秒降至67.3秒 |
| Luce Spark | RTX 3090上的Laguna XS.2 33B | 14.6 GiB内存占用下~100 tok/s |
| KVFlash | RTX 3090上256K上下文的Laguna XS 2.1 33B | 8K池配置下152.3 tok/s |
| Heterogeneous execution | R9700 + Strix Halo上的DeepSeek V4 | 解码86 tok/s;2K上下文预填充788 tok/s |
| Paged attention | Qwen 3.6 27B并发服务 | 注意力步骤1.35×;KV内存减少82% |
| Megakernel | RTX 3090上的Qwen 3.5 0.8B | 413 tok/s,1.87 tok/J |
模型链接指向测试配置使用的确切权重。草稿模型链接指向已发布的量化版本,或需要转换时的源检查点。
| 模型与优化项 | 阶段 | 加速比 |
|---|---|---|
| https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/model.safetensors-00001-of-00001.safetensors + Megakernel | 预填充+解码 | 预填充1.9×;解码1.55× |
| https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensors(转换为Q8_0格式,运行于R9700) | 解码 | 较Lucebox AR6.4×;较同草稿模型的llama.cpp3.8× |
| https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/blob/main/Laguna-XS-2.1-Q4_K_M.gguf + PFlash/KVFlash(搭配https://huggingface.co/Qwen/Qwen3-0.6B-GGUF/blob/main/Qwen3-0.6B-Q8_0.gguf) | 预填充 | 6.1×,256K上下文耗时从411秒降至67.3秒 |
| https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/blob/main/Laguna-XS-2.1-Q4_K_M.gguf + https://huggingface.co/Lucebox/Laguna-XS-2.1-DFlash-GGUF/blob/main/laguna-xs21-dflash-q4.gguf | 解码 | 256K上下文下1.7× |
| https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF/blob/main/google_gemma-4-26B-A4B-it-Q4_K_M.gguf + https://huggingface.co/Lucebox/gemma-4-26B-A4B-it-DFlash-GGUF/blob/main/gemma-4-26B-A4B-it-DFlash-q8_0.gguf | 解码 | 1.31× |
| https://huggingface.co/bartowski/google_gemma-4-31B-it-GGUF/blob/main/google_gemma-4-31B-it-Q4_K_M.gguf + https://huggingface.co/Lucebox/gemma-4-31B-it-DFlash-GGUF/blob/main/gemma-4-31B-it-DFlash-q8_0.gguf | 解码 | 3.2× |
| https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-ROCmFP3/blob/main/DeepSeek-V4-Flash-0731-ROCMFPX-MIX-STRIX.gguf + https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-DSpark-GGUF/blob/main/DeepSeek-V4-Flash-0731-DSpark-draft-Q4RMFP4-denseF16.gguf | 解码 | 较纯目标模型最高1.81×(32.7 vs 18.1 tok/s) |
| https://huggingface.co/bloomer010/Ling-3.0-flash-GGUF | 解码 | DGX Spark上AR中位数34.6 tok/s |
该引擎不绑定于特定参考显卡。NVIDIA架构通过CMake选择;HIP构建应针对设备的确切gfx架构。
| 架构 | 硬件 | 运行时 | 详情 | |
|---|---|---|---|---|
RDNA4 gfx1201 | Radeon AI PRO R9700 | ROCm 7.2 | Qwen 3.8 R9700快速开始 | |
RDNA3.5 gfx1151 | Ryzen AI MAX+ 395 / Strix Halo | ROCm 7.2 | DeepSeek V4 Strix配置文件 | |
RDNA3 gfx1100 | Radeon RX 7900 XT / XTX | ROCm 6+ | DeepSeek V4双AMD配置文件 | |
Ampere sm_86 | RTX 3090 | CUDA 12+ | https://github.com/Luce-Org/lucebox/pull/637 和 Megakernel结果 | |
Blackwell sm_120 | RTX 5090 | CUDA 12.8+ | https://github.com/Luce-Org/lucebox/pull/637 | |
Blackwell sm_121 | DGX Spark / GB10 | CUDA 12.9 | Qwen 3.5 NVFP4结果 | |
Ada sm_89 | RTX 4090 | CUDA 12+ | Linux 和 WSL2 社区测试 | |
Turing sm_75 | RTX 2080 Ti | CUDA 12.0 | DFlash结果 | |
Volta sm_70、Pascal sm_61 | V100、P40 | CUDA 12.0 | CUDA快速开始 | |
| 未图示 | Blackwell sm_110 | Jetson AGX Thor | CUDA 13.0 | Thor快速开始 |
| 硬件 | 模型 | 测试结果 |
|---|---|---|
| R9700 | https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensors | HumanEval平均208.1 tok/s;最佳请求227.8 tok/s |
| Strix Halo | https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-ROCmFP3/blob/main/DeepSeek-V4-Flash-0731-ROCMFPX-MIX-STRIX.gguf + https://huggingface.co/Lucebox/DeepSeek-V4-Flash-0731-DSpark-GGUF/blob/main/DeepSeek-V4-Flash-0731-DSpark-draft-Q4RMFP4-denseF16.gguf | 高接受度中位数32.7 tok/s;固定30条提示评估平均27.9 tok/s(使用全部6个路由专家) |
| RTX 5090 | Qwen 3.8 27B | 26,758token提示+1,024token续写场景下110.6 tok/s(https://github.com/Luce-Org/lucebox/pull/637) |
| 硬件 | 配置 | 实测结果 |
|---|---|---|
| 2x RTX 3090 + NVLink | Qwen 3.8 目标张量并行 + DFlash2 | 79.7 tok/s,自回归解码提速 2.16×(https://github.com/Luce-Org/lucebox/pull/637) |
| RX 7900 XT + Strix Halo | DeepSeek V4 启用全部六个专家 + DSpark 验证宽度 4 | 解码速度 45.0 至 47.7 tok/s;132,981 tokens 预填充速度 111.2 tok/s(https://github.com/Luce-Org/lucebox/pull/604#qualified-results) |
| R9700 + Strix Halo | DeepSeek V4 跨双 AMD 设备 | 解码速度 86 tok/s;2K tokens 预填充速度 788 tok/s |
这些运行使用不同的提示词、量化方式和推理策略。它们展示了哪些配置有效,而非跨硬件性能排名。
有关模型和硬件矩阵(包括单GPU和混合GPU配置文件),请参见推荐服务器配置。
harness/ 通过主流编码客户端运行 Lucebox 并检查服务器兼容性。
| 客户端 | 启动器 |
|---|---|
| Claude Code | run_claude_code.sh |
| Codex | run_codex.sh |
| OpenCode | run_opencode.sh |
| Hermes | run_hermes.sh |
| Pi | run_pi.sh |
| OpenClaw | run_openclaw.sh |
| Open WebUI | run_openwebui.sh |
设置服务器二进制文件和模型路径,然后运行启动器:
DFLASH_SERVER_BIN=server/build/dflash_server \
DFLASH_TARGET=server/models/Qwen3.8-27B-UD-IQ4_XS.gguf \
DFLASH_DRAFT=server/models/draft/qwen38-dflash2-q8_0.gguf \
MAX_CTX=32768 \
harness/clients/run_codex.sh
有关设置、无草稿目标和基准测试,请参见测试工具指南。
GHCR 上的预构建镜像跟踪 main 分支。挂载权重并在 :8000 上提供 OpenAI 兼容 API。
| GPU | 镜像标签 |
|---|---|
| NVIDIA (CUDA 12+) | :cuda12 |
| AMD (ROCm 6+) | :rocm |
将目标模型放入 server/models/,并将匹配的草稿模型放入 server/models/draft/。
运行适用于您 GPU 的镜像:
# NVIDIA
docker run --rm --gpus all -p 8000:8080 \
-v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:cuda12
# AMD
docker run --rm --device /dev/kfd --device /dev/dri \
--group-add video --group-add render --security-opt seccomp=unconfined \
-p 8000:8080 -v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:rocm
本快速启动运行上述 R9700 配置文件。完整的参数参考见服务器指南。
# 构建(ROCm 7.2+,RDNA4)
git clone --recurse-submodules https://github.com/Luce-Org/lucebox.git
cd lucebox
cmake -S server -B server/build-hip -G Ninja \
-DCMAKE_BUILD_TYPE=Release \
-DCMAKE_HIP_COMPILER=/opt/rocm/lib/llvm/bin/clang++ \
-DDFLASH27B_GPU_BACKEND=hip \
-DDFLASH27B_HIP_ARCHITECTURES=gfx1201 \
-DGGML_HIP_MMQ_MFMA=ON \
-DGGML_HIP_NO_VMM=ON
cmake --build server/build-hip --target dflash_server -j"$(nproc)"
# 目标模型和 DFlash2 草稿模型
mkdir -p models
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \
Qwen3.8-27B-UD-IQ4_XS.gguf --local-dir models
huggingface-cli download incoai/Qwen3.8-27B-DFlash2 --local-dir models/dflash2
python server/scripts/convert_dflash_to_gguf.py \
models/dflash2/model.safetensors models/qwen38-dflash2-f16.gguf
python server/scripts/quantize_dflash_draft.py \
models/qwen38-dflash2-f16.gguf models/qwen38-dflash2-q8_0.gguf --scheme q8_0
# 启动实测配置文件
./server/build-hip/dflash_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216
curl -s http://127.0.0.1:8216/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"messages":[{"role":"user","content":"Write a Python LRU cache."}],
"max_tokens":256,"temperature":0}'
| 主题 | 指南 |
|---|---|
| 推荐的模型和硬件配置文件 | 推荐配置 |
| 运行时参数 | 服务器参数参考 |
| OpenAI 聊天补全、响应和 Anthropic 消息 | API 参考 |
| CUDA、HIP 和混合设备部署 | 混合后端指南 |
| DeepSeek V4 单设备和异构配置文件 | DeepSeek V4 指南 |
| 环境变量 | 环境变量参考 |
| 服务器内部原理 | 架构 |
| 客户端集成和验证 | 测试工具指南 |
基准测试随各实现一同发布:DFlash、PFlash、Spark、KVFlash 和 Megakernel。
各优化和测试工具设置的视频教程。
| Luce KVFlash ▶ *** |
本地 AI 应该是默认选择,而非特权。私有数据、无按 token 计费、无供应商锁定。Lucebox 将 R9700 与 Strix Halo 配对,提供这款开箱即用的开源引擎。
有关硬件和当前基准测试,请访问 lucebo***。
我们欢迎针对 CUDA 和 HIP 内核、推测性推理、更多消费级 GPU 和 APU 支持、性能基准测试以及客户端测试工具的重点贡献。
@software{lucebox_2026,
title = {Lucebox: Speculative inference for heterogeneous consumer hardware},
author = {Lucebox},
url = {https://github.com/Luce-Org/lucebox},
year = {2026}
}
Apache 2.0 · Lucebo***
来自真实用户的反馈,见证轩辕镜像的优质服务