视频链接:Atlas专为DGX Spark优化的Rust引擎,启动是真的快,但小问题也多_哔哩哔哩_bilibili
- 专为DGX Spark优化的Rust引擎,启动是真快
- Qwen3.6-35B: 88-102 tok/s(比vLLM/SGLang快1.7-2.5x)
- 但支持模型有限,不过DGX上面能跑的也基本都有了
- 仓库 Avarok-Cybersecurity/atlas
部署方式
官方提供的quickstart
export HF_ENDPOINT=https://hf-mirror.com curl -fsSL https://atlasinference.io/quickstart.sh | sh脚本会自动检测 sparkrun,如缺失则通过 uvx 安装
手动安装
# 安装 sparkrun uvx sparkrun setup install # 列出官方 Atlas 配方 sparkrun recipe list --registry atlas # 运行指定配方(默认端口 8888) sparkrun run @atlas/qwen3.6-35b-a3b-fp8-mtp sparkrun run @atlas/qwen3.5-35b-a3b-nvfp4问题:Error response from daemon: No such container: sparkrun_7b2387b7d510768a_49960de5880e_solo
Cluster: sparkrun_7b2387b7d510768a_49960de5880e Serve command: spark serve Qwen/Qwen3.6-35B-A3B-FP8 --port 8888 --host 0.0.0.0 --gpu-memory-utilization 0.88 --max-seq-len 262144 --kv-cache-dtype bf16 --max-batch-size 2 --kv-high-precision-layers auto --scheduling-policy slai --max-prefill-tokens 32768 --oom-guard-mb 1024 --ssm-cache-slots 256 --mtp-quantization bf16 --enable-prefix-caching --speculative [6/6] Post-launch hooks — skipped Error response from daemon: No such container: sparkrun_7b2387b7d510768a_49960de5880e_solodocker 手动运行
docker run --rm \ --network host --gpus all --ipc=host \ -v ~/.cache/huggingface:/root/.cache/huggingface \ avarok/atlas-gb10:latest \ serve Qwen/Qwen3.6-35B-A3B-FP8 \ --port 8888 \ --max-seq-len 65536 \ --kv-cache-dtype fp8 \ --kv-high-precision-layers auto \ --gpu-memory-utilization 0.90 \ --scheduling-policy slai \ --enable-prefix-caching \ --speculative \ --num-drafts 2 \ --tool-call-parser qwen3_coder确认是否运行
curl http://localhost:8888/v1/models问题:提示没有指定--hosts
sparkrun run @atlas/qwen3.5-35b-a3b-nvfp4 --hosts localhostAtlas 官网之前漏了 --hosts localhost,后来已修复
测试
可以达到53 tps,另外由于也开放了 OpenAI-compatible API:http://localhost:8888/v1
,所以试了下,用CC switch计入CC,可以进行agentic task,但是表现还是没有特别如意,
还出现了复读机的现象
还有一些warnning和参数待后面一点点摸索了
占用内存也高