ghcr.io/luce-org/lucebox-hub

ghcr.io/luce-org/lucebox-hub:sha-45c6b52-cuda12

ghcr.iolinux/amd64sha-45c6b52-cuda12大小: 6.33 GB更新于 2026年10月7日
让 AI 帮你使用轩辕镜像?

如果你使用 DeepSeek、元宝 AI、Copilot、ChatGPT 等 AI 工具,协助配置轩辕镜像、编写 docker pull 命令、修改 Docker Compose 镜像地址、配置镜像加速、排查镜像拉取失败、分析报错日志等问题,请先让 AI 阅读并遵守轩辕镜像的规则文档。

只需在 AI 对话中先发送下面这段话即可:

请先阅读并遵守:https://xuanyuan.cloud/agents.md

未读文档前不要生成 pull 命令或排错方案。

查看 agents.md 用法指南与完整示范。国内用户首推 元宝 AI、DeepSeek 的深度思考模式,不推荐豆包 AI;Cursor 等编辑器可在对话 @ 该链接,或加入 User Rules。 若 AI 无法访问外链,可 打开说明文档 复制全文粘贴。文档会随站点更新,复制内容可能过期,建议定期检查。

镜像名称:ghcr.io/luce-org/lucebox-hub 参考标签:latest

面向异构设备与消费级 GPU 的推测推理方案。 内置自定义内核、推测式预填充与解码逻辑,针对每一款模型与硬件目标完成专属调优。


推理引擎优化特性

优化项实测环境结果
DFlash2单张 R9700 运行 Qwen 3.8 27B平均 208.1 tok/s,峰值 227.8 tok/s
DSparkStrix Halo 运行 DeepSeek V4,采用原生 top-6 配置高接受率中位数 32.7 tok/s;混合评估平均 27.9 tok/s
PFlash + KVFlashRTX 3090 运行上下文长度 256K 的 Laguna XS 2.1 33B预填充速度提升 6.1×,耗时从 411 s 降至 67.3 s
Luce SparkRTX 3090 运行 Laguna XS.2 33B显存占用 14.6 GiB,速度约 100 tok/s
KVFlashRTX 3090 运行上下文长度 256K 的 Laguna XS 2.1 33B搭配 8K 缓存池时速度 152.3 tok/s
异构执行R9700 + Strix Halo 运行 DeepSeek V4解码速度 86 tok/s;2K 上下文下预填充速度 788 tok/s
分页注意力 + 连续批处理R9700 运行 Qwen 3.8 27B + DFlash2;Strix Halo 运行 DeepSeek V4 Flash AR5 客户端并发(Qwen)总速度 300.9 tok/s;4 客户端并发(DeepSeek)输出窗口速度 48.4 tok/s
三层专家调度R9700 + Strix Halo + SSD 运行 DeepSeek V4.1 Flash代码场景解码速度 25-26 tok/s;在配置文件指定的 128K 上下文下,4K 预填充速度 118-121 tok/s
巨内核RTX 3090 运行 Qwen 3.5 0.8B速度 413 tok/s,能效比 1.87 tok/J
视觉(图像输入)R9700 运行 Qwen 3.8 27B 视觉模型 + Strix Halo 运行 DeepSeek V4 Flash 视觉模型,双机协同图文问答吞吐量是 DGX Spark 的 3.2×(每分钟 58 次 vs 18 次);同模型文件在 8 用户并发场景下速度快 2.4×

支持的模型与草稿器

每个徽章可跳转至实测环境所使用的完整权重文件。草稿器徽章将跳转至已发布的量化版本,若需额外转换则跳转至源检查点。

模型🤗 权重优化项(博客链接)阶段结果
Qwen 3.5 0.8B预填充 + 解码预填充速度 1.9×;解码速度 1.55×
R9700 上的 Qwen 3.8 27B解码是 Lucebox AR 速度的 6.4×;使用相同草稿器时是 llama.cpp 速度的 3.8×
Laguna XS 2.1 33B预填充256K 上下文下速度提升 6.1×,耗时从 411 s 降至 67.3 s
Laguna XS 2.1 33B解码256K 上下文下速度 1.7×
Gemma 4 26B-A4B解码速度 1.31×
Gemma 4 31B IT解码速度 3.2×
Strix Halo 上的 DeepSeek V4 Flash解码8K 上下文下速度 42 tok/s;纯启动配置下代码与数学场景速度 39 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/729)
R9700 + Strix Halo + SSD,带 --profile ds41-lucebox 的 DeepSeek V4.1 Flash解码在配置文件指定的 128K 上下文下,代码场景速度 25.4-25.8 tok/s;4K 提示词处理后速度 16.8-17.5 tok/s(对应 指南)
R9700 + Ryzen AI Max+ PRO 495 192 GB,带 --profile ds41-gorgon 的 DeepSeek V4.1 Flash预填充 + 解码14K-25K 上下文下预填充速度 985-1019 tok/s;所有专家常驻显存时代码场景解码速度 48.7 tok/s(对应 指南)
DGX Spark 上的 Ling 3.0 Flash 124B-A5.1B自回归解码自回归场景中位数速度 34.6 tok/s
R9700 上的 Qwen 3.8 27B 视觉模型图文问答8 用户并发时是 DGX Spark 上 llama.cpp 速度的 2.4×(耗时 10.5 s vs 25.4 s);单用户场景下速度 2.1×
R9700 上的 DeepSeek V4 Flash Visual 编码器,4 用户并发图文问答由 R9700 执行编码时,处理 16 张图像的首 token 生成速度快 1.5×

已测试硬件(GPU/APU)

本引擎不绑定单一参考显卡。NVIDIA 架构可通过 CMake 选项指定;HIP 构建版本需针对设备对应的精确 gfx 架构生成。

架构硬件运行时详情
RDNA4 gfx1201Radeon AI PRO R9700ROCm 7.2Qwen 3.8 R9700 快速入门
RDNA3.5 gfx1151Ryzen AI MAX+ 395 / Strix HaloROCm 7.2DeepSeek V4 Strix 配置文件
RDNA3 gfx1100Radeon RX 7900 XT / XTXROCm 6+DeepSeek V4 双 AMD 设备配置文件
Ampere sm_86RTX 3090CUDA 12+https://github.com/Luce-Org/lucebox/pull/637 与 巨内核测试结果
Blackwell sm_120RTX 5090CUDA 12.8+https://github.com/Luce-Org/lucebox/pull/637
Blackwell sm_121DGX Spark / GB10CUDA 12.9Qwen 3.5 NVFP4 测试结果
Ada sm_89RTX 4090CUDA 12+Linux 社区测试 与 WSL2 社区测试
Turing sm_75RTX 2080 TiCUDA 12.0DFlash 测试结果
Volta sm_70、Pascal sm_61V100、P40CUDA 12.0CUDA 快速入门
未展示Blackwell sm_110Jetson AGX ThorCUDA 13.0Thor 快速入门

单设备测试结果

硬件模型实测结果
R9700https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/blob/main/Qwen3.8-27B-UD-IQ4_XS.gguf + https://huggingface.co/incoai/Qwen3.8-27B-DFlash2/blob/main/model.safetensorsHumanEval 基准平均 208.1 tok/s;最佳单请求速度 227.8 tok/s
RTX 5090Qwen 3.8 27B处理 26758 token 提示词 + 1024 token 续写任务时速度 110.6 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/637)

异构与并行测试结果

硬件配置实测结果
2x RTX 3090 + NVLinkQwen 3.8 目标模型张量并行 + DFlash2速度 79.7 tok/s,是自回归解码速度的 2.16×(对应 https://github.com/Luce-Org/lucebox/pull/637)
RX 7900 XT + Strix HaloDeepSeek V4 启用全部 6 个专家 + DSpark 校验宽度 4解码速度 45.0~47.7 tok/s;*** token 上下文下预填充速度 111.2 tok/s(对应 https://github.com/Luce-Org/lucebox/pull/604#qualified-results)
R9700 + Strix HaloDeepSeek V4 跨两台 AMD 设备分布式运行解码速度 86 tok/s;2K 上下文下预填充速度 788 tok/s

以上测试使用了不同的提示词、量化方案与推理策略,仅用于验证对应配置的可用性,不代表跨硬件性能排名。

推荐配置方案

有关模型与硬件适配矩阵(包括单 GPU 与混合 GPU 配置文件)的内容,请参阅 推荐服务器配置。

DS4 指南中还记录了 Strix 长上下文稀疏验证器配置文件,以及 Qwen3-0.6B PFlash 集成方案。PFlash 是有损提示压缩技术;若需执行精确检索或真实上下文匹配基准测试,请将其关闭。

客户端测试套件

harness/ 目录可通过主流编码客户端运行 Lucebox,并校验服务器兼容性。

客户端启动器
Claude Coderun_claude_code.sh
Codexrun_codex.sh
OpenCoderun_opencode.sh
Hermesrun_hermes.sh
OMPrun_omp.sh
Pirun_pi.sh
OpenClawrun_openclaw.sh
Open WebUIrun_openwebui.sh

请先设置服务器二进制文件与模型路径,再运行对应启动器:

LUCE_SERVER_BIN=server/build/luce_server \
LUCE_TARGET=server/models/Qwen3.8-27B-UD-IQ4_XS.gguf \
LUCE_DRAFT=server/models/draft/qwen38-dflash2-q8_0.gguf \
MAX_CTX=32768 \
harness/clients/run_codex.sh

有关环境配置、无 draft 目标与基准测试的内容,请参阅 测试套件指南。

Docker 快速入门

GHCR 上的预构建镜像会跟踪 main 分支。挂载模型权重后,即可在 :8000 端口提供兼容 OpenAI 规范的 API 服务。

GPU镜像标签
NVIDIA(CUDA 12+):cuda12
AMD(ROCm 6+):rocm

请将主模型文件放置在 server/models/ 目录下,对应的 draft 模型文件放置在 server/models/draft/ 目录下。

根据所用 GPU 运行对应镜像:

# NVIDIA 设备
docker run --rm --gpus all -p 8000:8080 \
-v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:cuda12

# AMD 设备
docker run --rm --device /dev/kfd --device /dev/dri \
--group-add video --group-add render --security-opt seccomp=unconfined \
-p 8000:8080 -v "$PWD/server/models:/opt/lucebox-hub/server/models" \
ghcr.io/luce-org/lucebox-hub:rocm

容器会自动选择可容纳目标模型的 GPU(优先选用独立显卡而非核显,均不满足时选用显存最大的设备),并根据该 GPU 的显存自动设置上下文大小。serve 是默认命令,你可以直接在镜像名称后追加 luce_server 参数(也可以显式指定 serve),传入的参数会覆盖容器默认值。--target-device、--max-ctx 和 --profile 等参数均支持直接使用:

# 列出所有 GPU、模型信息与自动放置逻辑选定的设备
docker run --rm -v ... ghcr.io/luce-org/lucebox-hub:rocm devices

# 在 Strix Halo 上以适配配置文件运行 DeepSeek V4(DSpark draft 模型位于 models/draft/ 目录下)
docker run --rm -p 8000:8080 -v ... ghcr.io/luce-org/lucebox-hub:rocm --profile ds4-strix

# 手动指定绑定设备
docker run --rm -p 8000:8080 -v ... ghcr.io/luce-org/lucebox-hub:rocm --target-device hip:1

LUCE_TARGET、LUCE_TARGET_DEVICE、LUCE_MAX_CTX 与 LUCE_ARGS 等环境变量可在 compose 文件中实现相同的配置效果,详见 server/scripts/entrypoint.sh 的头部说明。

运行服务器

本快速入门示例将运行上文提到的 R9700 配置文件。完整的参数参考请查看 服务器指南。

# 编译(ROCm 7.2+,RDNA4 架构)
git clone --recurse-submodules https://github.com/Luce-Org/lucebox.git
cd lucebox
cmake -S server -B server/build-hip -G Ninja \
-DCMAKE_BUILD_TYPE=Release \
-DCMAKE_HIP_COMPILER=/opt/rocm/lib/llvm/bin/clang++ \
-DLUCE_GPU_BACKEND=hip \
-DLUCE_HIP_ARCHITECTURES=gfx1201 \
-DGGML_HIP_MMQ_MFMA=ON \
-DGGML_HIP_NO_VMM=ON
cmake --build server/build-hip --target luce_server -j"$(nproc)"

# 准备主模型与 DFlash2 draft 模型
mkdir -p models
huggingface-cli download unsloth/Qwen3.8-27B-GGUF \
Qwen3.8-27B-UD-IQ4_XS.gguf --local-dir models
huggingface-cli download incoai/Qwen3.8-27B-DFlash2 --local-dir models/dflash2
python server/scripts/convert_dflash_to_gguf.py \
models/dflash2/model.safetensors models/qwen38-dflash2-f16.gguf
python server/scripts/quantize_dflash_draft.py \
models/qwen38-dflash2-f16.gguf models/qwen38-dflash2-q8_0.gguf --scheme q8_0

# 运行适配好的配置文件
./server/build-hip/luce_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 131072 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216

curl -s http://127.0.0.1:8216/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{"messages":[{"role":"user","content":"Write a Python LRU cache."}],
"max_tokens":256,"temperature":0}'

若要支持最多 N 个并发请求,可使用以下启动命令(基于相同的 Qwen 主模型与 DFlash2 draft 模型)。请将 N 替换为所需的并发数(示例中设为 5),Qwen 会根据可用 GPU 显存自动调整共享 KV 池的大小。

N=5
./server/build-hip/luce_server models/Qwen3.8-27B-UD-IQ4_XS.gguf \
--draft models/qwen38-dflash2-q8_0.gguf \
--draft-block-size 16 --max-ctx 16384 \
--paged-attention --max-concurrency "$N" \
--cache-type-k q8_0 --cache-type-v q8_0 \
--port 8216

有关 Qwen 与 DeepSeek V4 Flash 的实测结果、延迟数据与启动设置,请参阅 Lucebox 中的连续批处理。

文档

主题指南
推荐模型与硬件配置文件推荐配置
运行时参数服务器参数参考
OpenAI 聊天补全、Responses 接口与 Anthropic Messages 接口API 参考
CUDA、HIP 与混合设备部署混合后端指南
DeepSeek V4 单设备与异构配置文件DeepSeek V4 指南
在 R9700 + Strix Halo + SSD 上运行 DeepSeek V4.1 FlashDeepSeek V4.1 指南
图像输入(支持 Qwen3.8、DeepSeek V4 Flash Vision)图像输入指南
环境变量环境参考
服务器内部实现架构说明
客户端集成与适配认证测试套件指南
服务器引擎组件引擎组件

各专项优化的基准测试结果随对应实现一同发布:DFlash、PFlash、Spark、KVFlash 与 Megakernel。


教程

提供各优化项与测试套件配置的视频教程。

Luce KVFlash ▶ ***

Lucebox 专用设备

本地 AI 应当是默认选项,而非少数人才享有的特权。全程数据留存在本地、无按 Token 计费、也不存在厂商锁定。Lucebox 将 R9700 与 Strix Halo 搭配,交付预配置就绪、可直接运行的开源引擎。

你可以访问 lucebo*** 查看硬件详情和当前基准测试结果。


征集贡献

我们欢迎来自社区的定向贡献,贡献范围涵盖 CUDA 与 HIP 内核、投机推理、更多消费级 GPU 和 APU 的适配支持、性能基准测试以及客户端测试套件。


引用

@software{lucebox_2026,
title = {Lucebox: Speculative inference for heterogeneous consumer hardware},
author = {Lucebox},
url = {https://github.com/Luce-Org/lucebox},
year = {2026}
}

社区

  • *******: ***.gg/yHfswqZmJQ
  • 官网: lucebo***
  • Issue 反馈: https://github.com/Luce-Org/lucebox/issues
  • 博客: lucebo***/blog

Apache 2.0 许可 · Lucebo***

用户好评

来自真实用户的反馈,见证轩辕镜像的优质服务

用户头像

oldzhang

运维工程师

Linux服务器

5

"Docker访问体验非常流畅,大镜像也能快速完成下载。"

官方技术交流群:问题咨询请:提交工单
专业版 · 高速稳定拉取镜像
50GB 仅 ¥8/年
高速镜像下载在线技术支持99.95% SLA 保障付费会员免广告