GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径
【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX
GenieX 是面向高通骁龙设备的端侧生成式 AI 推理运行时,可以把 Hugging Face 上的 GGUF 模型或 Qualcomm AI Hub 的预编译模型包拉到本地,直接跑在 Hexagon NPU、Adreno GPU 或 CPU 上。它底层是同一套 C SDK,对外提供 CLI、Python、Android、Docker 和 OpenAI 兼容服务 5 种入口,且仅支持骁龙平台。
双运行时设计:llama.cpp 走覆盖,AI Engine Direct 走性能
GenieX 内置两套推理后端,分别解决"能不能跑"和"跑得多快":
llama_cpp:走高通的 GGML Hexagon 后端,可加载 Hugging Face 上几乎任意 GGUF 模型,CPU、GPU、NPU 都能跑,是模型覆盖最广的路径;qairt(Qualcomm AI Engine Direct):只接受按芯片组预编译、预量化的模型包,且只跑在 NPU 上,换来的是骁龙上最快的 NPU 路径。
选哪个取决于模型来源:自己手里的 GGUF 用前者,AI Hub 上发布的模型用后者。两条路径的详细对比见 平台与运行时文档。
骁龙平台支持清单:Windows ARM64、Android 与 Linux ARM64
GenieX 不做 x86 构建,只覆盖三类骁龙设备:
| 方向 | 芯片 | 可用入口 |
|---|---|---|
| 计算(Copilot+ PC) | 骁龙 X Elite / X2 Elite | CLI、Python、本地服务 |
| 移动 | 骁龙 8 Elite / 8 Elite Gen 5 | Android SDK(Kotlin/Java) |
| IoT | Dragonwing IQ-9075 / IQ-8275 | CLI、Docker、Python |
芯片组会自动探测,也可用geniex config get chipset确认、geniex config set chipset手动指定。计算单元方面有 4 个别名:npu(默认)、gpu、cpu,以及骁龙上速度最快的hybrid——后者把每个算子按 HTP/CPU 各自擅长点分发。
模型怎么选:GGUF 选 Q4_0 才能上 NPU
拉 GGUF 模型时,CLI 会让你选精度,而精度直接决定模型落在哪块硬件上:
Q4_0(默认):llama.cpp 中对 Hexagon NPU 支持最好的格式,大多数模型建议选它;Q8_0/F16:质量更高但体积和耗时约 2 倍,通常跑在 GPU/CPU 上;- AI Hub 模型包:量化在编译期就定死(多为
w4a16),运行时无法更改,要换精度只能换一个模型包。
模态方面:文本所有模型都支持;图像输入任何 VLM 都行;音频输入仅支持 llama.cpp 后端中带 conformer 编码器的 mmproj 模型(如google/gemma-4-E2B-it-qat-q4_0-gguf),且一次对话可以同时带文本、图片和音频。完整清单见 模型支持文档。
从安装到首次推理:Linux 一行装好,geniex infer 开聊
Linux ARM64 上安装 CLI 只需要一行(无需 sudo):
curl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | shWindows ARM64 用户从发行版下载安装包运行即可;Python 方向则是pip install geniex(另有geniex-llama-cpp、geniex-qairt两个只装单一后端的精简包);Android 方向在build.gradle.kts中加入com.qualcomm.qti:geniex-android依赖。
装好后,一行命令就能和模型对话(VLM 直接拖入图片):
geniex infer google/gemma-4-E4B-it-qat-q4_0-gguf # HF 的 GGUF → llama.cpp geniex infer ai-hub-models/Qwen2.5-VL-7B-Instruct # AI Hub 模型包 → NPUPython 侧的用法对齐 Hugging Face transformers 风格:AutoModelForCausalLM.from_pretrained("unsloth/Qwen3.5-2B-GGUF", precision="Q4_0")后调用model.generate(prompt, stream=True)即可流式输出,代码示例见 bindings/python/。
OpenAI 兼容服务:把本地模型接进 LangChain 等现有应用
geniex serve启动一个本地 OpenAI 兼容 API,默认监听http://127.0.0.1:18181/v1,任何 OpenAI 客户端改个base_url就能复用,LangChain 这类 agent 框架同样适用:
geniex pull ai-hub-models/Qwen3-4B-Instruct-2507 geniex serve服务自带 Swagger UI(直接访问http://127.0.0.1:18181),端点包括/v1/chat/completions(支持 VLM 图文混排与工具调用)、面向编辑器代码补全的/v1/completions,以及模型列表查询。
日常会用到的命令整理如下:
| 命令 | 功能 |
|---|---|
geniex pull <模型> | 从 AI Hub / HF / 本地路径拉取模型进缓存 |
geniex infer <模型> | 交互式推理,支持--compute、--think、--nctx |
geniex serve | 启动 OpenAI 兼容本地服务 |
geniex list/geniex remove <模型>/geniex clean | 查看 / 删除 / 清空缓存模型 |
geniex-bench | 独立基准工具,测 TTFT、prefill 与 decode 速度 |
用 geniex-bench 实测 NPU 收益,从文档与测试入手
想知道模型在你设备上真实快多少,用独立的geniex-bench工具测三个指标:首 token 延迟(ttft)、prefill 与 decode 速度。官方教程给出的实测参考值:骁龙 X Elite 上 Qwen3-1.7B(Q4_0)的hybrid模式 decode 约 27.4 tok/s,比纯 CPU 的 18.5 tok/s 高出 48%;Dragonwing IQ-9075 上 22.6 对 15.2 tok/s。工具支持矩阵扫描多种(模型 × 设备)组合并输出 JSON 报告,详见 基准测试教程。
仓库内还有这些入口可以深入:CLI 命令参考、Python 绑定文档(bindings/python/)、Android 示例与 集成文档,以及覆盖 CLI、两种后端的 测试套件。项目采用 BSD 3-Clause 许可,目前处于开发者预览阶段。
端侧推理的价值很直接:数据不出设备、无网络延迟,也没有按 token 计费。下一步建议在你的骁龙设备上装好 CLI,跑一条geniex infer ai-hub-models/Qwen3-4B,10 分钟内看到第一个本地回答。
【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考