如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。
只需在 AI 对话中先发送下面这段话即可:
请先阅读并遵守:https://xuanyuan.cloud/agents.md
未读文档前不要生成 pull 命令或排错方案。查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。
镜像名称:ghcr.io/luce-org/lucebox-hub
参考标签:latest
面向异构设备与消费级 GPU 的推测推理方案。 内置自定义内核、推测式预填充与解码逻辑,针对每一款模型与硬件目标完成专属调优。
| 优化项 | 实测环境 | 结果 |
|---|---|---|
| DFlash2 | 单张 R9700 运行 Qwen 3.8 27B | 平均 208.1 tok/s,峰值 227.8 tok/s |
| DSpark | Strix Halo 运行 DeepSeek V4,采用原生 top-6 配置 | 高接受率中位数 32.7 tok/s;混合评估平均 27.9 tok/s |
| PFlash + KVFlash | RTX 3090 运行上下文长度 256K 的 Laguna XS 2.1 33B | 预填充速度提升 6.1×,耗时从 411 s 降至 67.3 s |
| Luce Spark | RTX 3090 运行 Laguna XS.2 33B | 显存占用 14.6 GiB,速度约 100 tok/s |
| KVFlash | RTX 3090 运行上下文长度 256K 的 Laguna XS 2.1 33B | 搭配 8K 缓存池时速度 152.3 tok/s |
| 异构执行 | R9700 + Strix Halo 运行 DeepSeek V4 | 解码速度 86 tok/s;2K 上下文下预填充速度 788 tok/s |
| 分页注意力 + 连续批处理 | R9700 运行 Qwen 3.8 27B + DFlash2;Strix Halo 运行 DeepSeek V4 Flash AR | 5 客户端并发(Qwen)总速度 300.9 tok/s;4 客户端并发(DeepSeek)输出窗口速度 48.4 tok/s |
| 三层专家调度 | R9700 + Strix Halo + SSD 运行 DeepSeek V4.1 Flash | 代码场景解码速度 25-26 tok/s;在配置文件指定的 128K 上下文下,4K 预填充速度 118-121 tok/s |
| 巨内核 | RTX 3090 运行 Qwen 3.5 0.8B | 速度 413 tok/s,能效比 1.87 tok/J |
| 视觉(图像输入) | R9700 运行 Qwen 3.8 27B 视觉模型 + Strix Halo 运行 DeepSeek V4 Flash 视觉模型,双机协同 | 图文问答吞吐量是 DGX Spark 的 3.2×(每分钟 58 次 vs 18 次);同模型文件在 8 用户并发场景下速度快 2.4× |
每个徽章可跳转至实测环境所使用的完整权重文件。草稿器徽章将跳转至已发布的量化版本,若需额外转换则跳转至源检查点。
| 模型 | 🤗 权重 | 优化项(博客链接) | 阶段 | 结果 |
|---|---|---|---|---|
| Qwen 3.5 0.8B | 预填充 + 解码 | 预填充速度 1.9×;解码速度 1.55× | ||
| R9700 上的 Qwen 3.8 27B | 解码 | 是 Lucebox AR 速度的 6.4×;使用相同草稿器时是 llama.cpp 速度的 3.8× | ||
| Laguna XS 2.1 33B | 预填充 | 256K 上下文下速度提升 6.1×,耗时从 411 s 降至 67.3 s | ||
| Laguna XS 2.1 33B | 解码 | 256K 上下文下速度 1.7× | ||
| Gemma 4 26B-A4B | 解码 | 速度 1.31× | ||
| Gemma 4 31B IT | 解码 | 速度 3.2× | ||
| Strix Halo 上的 DeepSeek V4 Flash | 解码 | 8K 上下文下速度 42 tok/s;纯启动配置下代码与数学场景速度 39 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/729) | ||
R9700 + Strix Halo + SSD,带 --profile ds41-lucebox 的 DeepSeek V4.1 Flash | 解码 | 在配置文件指定的 128K 上下文下,代码场景速度 25.4-25.8 tok/s;4K 提示词处理后速度 16.8-17.5 tok/s(对应 指南) | ||
R9700 + Ryzen AI Max+ PRO 495 192 GB,带 --profile ds41-gorgon 的 DeepSeek V4.1 Flash | 预填充 + 解码 | 14K-25K 上下文下预填充速度 985-1019 tok/s;所有专家常驻显存时代码场景解码速度 48.7 tok/s(对应 指南) | ||
| DGX Spark 上的 Ling 3.0 Flash 124B-A5.1B | 自回归 | 解码 | 自回归场景中位数速度 34.6 tok/s | |
| R9700 上的 Qwen 3.8 27B 视觉模型 | 图文问答 | 8 用户并发时是 DGX Spark 上 llama.cpp 速度的 2.4×(耗时 10.5 s vs 25.4 s);单用户场景下速度 2.1× | ||
| R9700 上的 DeepSeek V4 Flash Visual 编码器,4 用户并发 | 图文问答 | 由 R9700 执行编码时,处理 16 张图像的首 token 生成速度快 1.5× |
本引擎不绑定单一参考显卡。NVIDIA 架构可通过 CMake 选项指定;HIP 构建版本需针对设备对应的精确 gfx 架构生成。
| 架构 | 硬件 | 运行时 | 详情 | |
|---|---|---|---|---|
RDNA4 gfx1201 | Radeon AI PRO R9700 | ROCm 7.2 | Qwen 3.8 R9700 快速入门 | |
RDNA3.5 gfx1151 | Ryzen AI MAX+ 395 / Strix Halo | ROCm 7.2 | DeepSeek V4 Strix 配置文件 | |
RDNA3 gfx1100 | Radeon RX 7900 XT / XTX | ROCm 6+ | DeepSeek V4 双 AMD 设备配置文件 | |
Ampere sm_86 | RTX 3090 | CUDA 12+ | https://github.com/Luce-Org/lucebox/pull/637 与 巨内核测试结果 | |
Blackwell sm_120 | RTX 5090 | CUDA 12.8+ | https://github.com/Luce-Org/lucebox/pull/637 | |
Blackwell sm_121 | DGX Spark / GB10 | CUDA 12.9 | Qwen 3.5 NVFP4 测试结果 | |
Ada sm_89 | RTX 4090 | CUDA 12+ | Linux 社区测试 与 WSL2 社区测试 | |
Turing sm_75 | RTX 2080 Ti | CUDA 12.0 | DFlash 测试结果 | |
Volta sm_70、Pascal sm_61 | V100、P40 | CUDA 12.0 | CUDA 快速入门 | |
| 未展示 | Blackwell sm_110 | Jetson AGX Thor | CUDA 13.0 | Thor 快速入门 |
| 硬件 | 模型 | 实测结果 |
|---|---|---|
| R9700 | https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensors | HumanEval 基准平均 208.1 tok/s;最佳单请求速度 227.8 tok/s |
| RTX 5090 | Qwen 3.8 27B | 处理 26758 token 提示词 + 1024 token 续写任务时速度 110.6 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/637) |
| 硬件 | 配置 | 实测结果 |
|---|---|---|
| 2x RTX 3090 + NVLink | Qwen 3.8 目标模型张量并行 + DFlash2 | 速度 79.7 tok/s,是自回归解码速度的 2.16×(对应 https://github.com/Luce-Org/lucebox/pull/637) |
| RX 7900 XT + Strix Halo | DeepSeek V4 启用全部 6 个专家 + DSpark 校验宽度 4 | 解码速度 45.0~47.7 tok/s;*** token 上下文下预填充速度 111.2 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/604#qualified-results) |
| R9700 + Strix Halo | DeepSeek V4 跨两台 AMD 设备分布式运行 | 解码速度 86 tok/s;2K 上下文下预填充速度 788 tok/s |
以上测试使用了不同的提示词、量化方案与推理策略,仅用于验证对应配置的可用性,不代表跨硬件性能排名。
有关模型与硬件适配矩阵(包括单 GPU 与混合 GPU 配置文件)的内容,请参阅 推荐服务器配置。
DS4 指南中还记录了 Strix 长上下文稀疏验证器配置文件,以及 Qwen3-0.6B PFlash 集成方案。PFlash 是有损提示压缩技术;若需执行精确检索或真实上下文匹配基准测试,请将其关闭。
harness/ 目录可通过主流编码客户端运行 Lucebox,并校验服务器兼容性。
| 客户端 | 启动器 |
|---|---|
| Claude Code | run_claude_code.sh |
| Codex | run_codex.sh |
| OpenCode | run_opencode.sh |
| Hermes | run_hermes.sh |
| OMP | run_omp.sh |
| Pi | run_pi.sh |
| OpenClaw | run_openclaw.sh |
| Open WebUI | run_openwebui.sh |
请先设置服务器二进制文件与模型路径,再运行对应启动器:
LUCE_SERVER_BIN=server/build/luce_server \
LUCE_TARGET=server/models/Qwen3.8-27B-UD-IQ4_XS.gguf \
LUCE_DRAFT=server/models/draft/qwen38-dflash2-q8_0.gguf \
MAX_CTX=32768 \
harness/clients/run_codex.sh
有关环境配置、无 draft 目标与基准测试的内容,请参阅 测试套件指南。
GHCR 上的预构建镜像会跟踪 main 分支。挂载模型权重后,即可在 :8000 端口提供兼容 OpenAI 规范的 API 服务。
| GPU | 镜像标签 |
|---|---|
| NVIDIA(CUDA 12+) | :cuda12 |
| AMD(ROCm 6+) | :rocm |
请将主模型文件放置在 server/models/ 目录下,对应的 draft 模型文件放置在 server/models/draft/ 目录下。
根据所用 GPU 运行对应镜像:
# NVIDIA 设备
docker run --rm --gpus all -p 8000:8080 \
-v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:cuda12
# AMD 设备
docker run --rm --device /dev/kfd --device /dev/dri \
--group-add video --group-add render --security-opt seccomp=unconfined \
-p 8000:8080 -v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:rocm
容器会自动选择可容纳目标模型的 GPU(优先选用独立显卡而非核显,均不满足时选用显存最大的设备),并根据该 GPU 的显存自动设置上下文大小。serve 是默认命令,你可以直接在镜像名称后追加 luce_server 参数(也可以显式指定 serve),传入的参数会覆盖容器默认值。--target-device、--max-ctx 和 --profile 等参数均支持直接使用:
# 列出所有 GPU、模型信息与自动放置逻辑选定的设备
docker run --rm -v ... ghcr.io/luce-org/lucebox-hub:rocm devices
# 在 Strix Halo 上以适配配置文件运行 DeepSeek V4(DSpark draft 模型位于 models/draft/ 目录下)
docker run --rm -p 8000:8080 -v ... ghcr.io/luce-org/lucebox-hub:rocm --profile ds4-strix
# 手动指定绑定设备
docker run --rm -p 8000:8080 -v ... ghcr.io/luce-org/lucebox-hub:rocm --target-device hip:1
LUCE_TARGET、LUCE_TARGET_DEVICE、LUCE_MAX_CTX 与 LUCE_ARGS 等环境变量可在 compose 文件中实现相同的配置效果,详见 server/scripts/entrypoint.sh 的头部说明。
本快速入门示例将运行上文提到的 R9700 配置文件。完整的参数参考请查看 服务器指南。
# 编译(ROCm 7.2+,RDNA4 架构)
git clone --recurse-submodules https://github.com/Luce-Org/lucebox.git
cd lucebox
cmake -S server -B server/build-hip -G Ninja \
-DCMAKE_BUILD_TYPE=Release \
-DCMAKE_HIP_COMPILER=/opt/rocm/lib/llvm/bin/clang++ \
-DLUCE_GPU_BACKEND=hip \
-DLUCE_HIP_ARCHITECTURES=gfx1201 \
-DGGML_HIP_MMQ_MFMA=ON \
-DGGML_HIP_NO_VMM=ON
cmake --build server/build-hip --target luce_server -j"$(nproc)"
# 准备主模型与 DFlash2 draft 模型
mkdir -p models
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \
Qwen3.8-27B-UD-IQ4_XS.gguf --local-dir models
huggingface-cli download incoai/Qwen3.8-27B-DFlash2 --local-dir models/dflash2
python server/scripts/convert_dflash_to_gguf.py \
models/dflash2/model.safetensors models/qwen38-dflash2-f16.gguf
python server/scripts/quantize_dflash_draft.py \
models/qwen38-dflash2-f16.gguf models/qwen38-dflash2-q8_0.gguf --scheme q8_0
# 运行适配好的配置文件
./server/build-hip/luce_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216
curl -s http://127.0.0.1:8216/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"messages":[{"role":"user","content":"Write a Python LRU cache."}],
"max_tokens":256,"temperature":0}'
若要支持最多 N 个并发请求,可使用以下启动命令(基于相同的 Qwen 主模型与 DFlash2 draft 模型)。请将 N 替换为所需的并发数(示例中设为 5),Qwen 会根据可用 GPU 显存自动调整共享 KV 池的大小。
N=5
./server/build-hip/luce_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 16384 \
--paged-attention --max-concurrency "$N" \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216
有关 Qwen 与 DeepSeek V4 Flash 的实测结果、延迟数据与启动设置,请参阅 Lucebox 中的连续批处理。
| 主题 | 指南 |
|---|---|
| 推荐模型与硬件配置文件 | 推荐配置 |
| 运行时参数 | 服务器参数参考 |
| OpenAI 聊天补全、Responses 接口与 Anthropic Messages 接口 | API 参考 |
| CUDA、HIP 与混合设备部署 | 混合后端指南 |
| DeepSeek V4 单设备与异构配置文件 | DeepSeek V4 指南 |
| 在 R9700 + Strix Halo + SSD 上运行 DeepSeek V4.1 Flash | DeepSeek V4.1 指南 |
| 图像输入(支持 Qwen3.8、DeepSeek V4 Flash Vision) | 图像输入指南 |
| 环境变量 | 环境参考 |
| 服务器内部实现 | 架构说明 |
| 客户端集成与适配认证 | 测试套件指南 |
| 服务器引擎组件 | 引擎组件 |
各专项优化的基准测试结果随对应实现一同发布:DFlash、PFlash、Spark、KVFlash 与 Megakernel。
提供各优化项与测试套件配置的视频教程。
| Luce KVFlash ▶ *** |
本地 AI 应当是默认选项,而非少数人才享有的特权。全程数据留存在本地、无按 Token 计费、也不存在厂商锁定。Lucebox 将 R9700 与 Strix Halo 搭配,交付预配置就绪、可直接运行的开源引擎。
你可以访问 lucebo*** 查看硬件详情和当前基准测试结果。
我们欢迎来自社区的定向贡献,贡献范围涵盖 CUDA 与 HIP 内核、投机推理、更多消费级 GPU 和 APU 的适配支持、性能基准测试以及客户端测试套件。
@software{lucebox_2026,
title = {Lucebox: Speculative inference for heterogeneous consumer hardware},
author = {Lucebox},
url = {https://github.com/Luce-Org/lucebox},
year = {2026}
}
Apache 2.0 许可 · Lucebo***
来自真实用户的反馈,见证轩辕镜像的优质服务