news 2026/9/19 4:53:35

GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径

GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径

【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX

GenieX 是面向高通骁龙设备的端侧生成式 AI 推理运行时,可以把 Hugging Face 上的 GGUF 模型或 Qualcomm AI Hub 的预编译模型包拉到本地,直接跑在 Hexagon NPU、Adreno GPU 或 CPU 上。它底层是同一套 C SDK,对外提供 CLI、Python、Android、Docker 和 OpenAI 兼容服务 5 种入口,且仅支持骁龙平台。

双运行时设计:llama.cpp 走覆盖,AI Engine Direct 走性能

GenieX 内置两套推理后端,分别解决"能不能跑"和"跑得多快":

  • llama_cpp:走高通的 GGML Hexagon 后端,可加载 Hugging Face 上几乎任意 GGUF 模型,CPU、GPU、NPU 都能跑,是模型覆盖最广的路径;
  • qairt(Qualcomm AI Engine Direct):只接受按芯片组预编译、预量化的模型包,且只跑在 NPU 上,换来的是骁龙上最快的 NPU 路径。

选哪个取决于模型来源:自己手里的 GGUF 用前者,AI Hub 上发布的模型用后者。两条路径的详细对比见 平台与运行时文档。

骁龙平台支持清单:Windows ARM64、Android 与 Linux ARM64

GenieX 不做 x86 构建,只覆盖三类骁龙设备:

方向芯片可用入口
计算(Copilot+ PC)骁龙 X Elite / X2 EliteCLI、Python、本地服务
移动骁龙 8 Elite / 8 Elite Gen 5Android SDK(Kotlin/Java)
IoTDragonwing IQ-9075 / IQ-8275CLI、Docker、Python

芯片组会自动探测,也可用geniex config get chipset确认、geniex config set chipset手动指定。计算单元方面有 4 个别名:npu(默认)、gpucpu,以及骁龙上速度最快的hybrid——后者把每个算子按 HTP/CPU 各自擅长点分发。

模型怎么选:GGUF 选 Q4_0 才能上 NPU

拉 GGUF 模型时,CLI 会让你选精度,而精度直接决定模型落在哪块硬件上:

  • Q4_0(默认):llama.cpp 中对 Hexagon NPU 支持最好的格式,大多数模型建议选它;
  • Q8_0/F16:质量更高但体积和耗时约 2 倍,通常跑在 GPU/CPU 上;
  • AI Hub 模型包:量化在编译期就定死(多为w4a16),运行时无法更改,要换精度只能换一个模型包。

模态方面:文本所有模型都支持;图像输入任何 VLM 都行;音频输入仅支持 llama.cpp 后端中带 conformer 编码器的 mmproj 模型(如google/gemma-4-E2B-it-qat-q4_0-gguf),且一次对话可以同时带文本、图片和音频。完整清单见 模型支持文档。

从安装到首次推理:Linux 一行装好,geniex infer 开聊

Linux ARM64 上安装 CLI 只需要一行(无需 sudo):

curl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | sh

Windows ARM64 用户从发行版下载安装包运行即可;Python 方向则是pip install geniex(另有geniex-llama-cppgeniex-qairt两个只装单一后端的精简包);Android 方向在build.gradle.kts中加入com.qualcomm.qti:geniex-android依赖。

装好后,一行命令就能和模型对话(VLM 直接拖入图片):

geniex infer google/gemma-4-E4B-it-qat-q4_0-gguf # HF 的 GGUF → llama.cpp geniex infer ai-hub-models/Qwen2.5-VL-7B-Instruct # AI Hub 模型包 → NPU

Python 侧的用法对齐 Hugging Face transformers 风格:AutoModelForCausalLM.from_pretrained("unsloth/Qwen3.5-2B-GGUF", precision="Q4_0")后调用model.generate(prompt, stream=True)即可流式输出,代码示例见 bindings/python/。

OpenAI 兼容服务:把本地模型接进 LangChain 等现有应用

geniex serve启动一个本地 OpenAI 兼容 API,默认监听http://127.0.0.1:18181/v1,任何 OpenAI 客户端改个base_url就能复用,LangChain 这类 agent 框架同样适用:

geniex pull ai-hub-models/Qwen3-4B-Instruct-2507 geniex serve

服务自带 Swagger UI(直接访问http://127.0.0.1:18181),端点包括/v1/chat/completions(支持 VLM 图文混排与工具调用)、面向编辑器代码补全的/v1/completions,以及模型列表查询。

日常会用到的命令整理如下:

命令功能
geniex pull <模型>从 AI Hub / HF / 本地路径拉取模型进缓存
geniex infer <模型>交互式推理,支持--compute--think--nctx
geniex serve启动 OpenAI 兼容本地服务
geniex list/geniex remove <模型>/geniex clean查看 / 删除 / 清空缓存模型
geniex-bench独立基准工具,测 TTFT、prefill 与 decode 速度

用 geniex-bench 实测 NPU 收益,从文档与测试入手

想知道模型在你设备上真实快多少,用独立的geniex-bench工具测三个指标:首 token 延迟(ttft)、prefill 与 decode 速度。官方教程给出的实测参考值:骁龙 X Elite 上 Qwen3-1.7B(Q4_0)的hybrid模式 decode 约 27.4 tok/s,比纯 CPU 的 18.5 tok/s 高出 48%;Dragonwing IQ-9075 上 22.6 对 15.2 tok/s。工具支持矩阵扫描多种(模型 × 设备)组合并输出 JSON 报告,详见 基准测试教程。

仓库内还有这些入口可以深入:CLI 命令参考、Python 绑定文档(bindings/python/)、Android 示例与 集成文档,以及覆盖 CLI、两种后端的 测试套件。项目采用 BSD 3-Clause 许可,目前处于开发者预览阶段。

端侧推理的价值很直接:数据不出设备、无网络延迟,也没有按 token 计费。下一步建议在你的骁龙设备上装好 CLI,跑一条geniex infer ai-hub-models/Qwen3-4B,10 分钟内看到第一个本地回答。

【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 4:53:12

基于深度学习的鸟类识别检测系统:YOLO实战全解析

1. 项目概述与需求拆解1.1 为什么鸟类识别适合做毕设每年到了毕设选题季&#xff0c;总有学弟学妹来问我&#xff1a;"学长&#xff0c;深度学习方向的题目到底选什么好&#xff1f;"我的回答一直很明确&#xff1a;选一个数据好找、场景直观、算法成熟但又有优化空间…

作者头像 李华
网站建设 2026/9/19 4:52:55

Rust 打造 OpenObserve:替代 Elasticsearch 和 Prometheus 的可观测性实战

1. 为什么我又把日志和指标系统折腾了一遍如果你运维过中等规模的线上环境&#xff0c;大概率经历过这样的场景&#xff1a;Elasticsearch 集群的 JVM 堆内存三天两头告警&#xff0c;Prometheus 的 TSDB 在高峰期写入延迟飙升&#xff0c;Grafana 面板加载慢得让人想砸键盘。更…

作者头像 李华
网站建设 2026/9/19 4:52:18

SpringBoot打造高校双创服务平台架构与实践

1. 项目背景与核心价值在高校创新创业教育蓬勃发展的当下&#xff0c;一个真正好用的大学生双创服务平台应该长什么样&#xff1f;去年我参与指导某高校创业学院信息化建设时&#xff0c;发现现有平台普遍存在三个痛点&#xff1a;赛事信息分散在十几个微信群、优秀案例展示停留…

作者头像 李华
网站建设 2026/9/19 4:50:44

OpenClaw Skill技术架构与自动化开发实践

1. OpenClaw Skill 20 篇系列博客核心价值解析作为一个长期关注自动化技术发展的从业者&#xff0c;我完整跟踪了OpenClaw Skill系列的全部20篇技术博客。这个系列最令人印象深刻的是它构建了一套完整的技能开发体系&#xff0c;从基础概念到企业级部署&#xff0c;形成了一个闭…

作者头像 李华
网站建设 2026/9/19 4:50:39

Laravel空白页问题排查与解决方案

1. 问题现象与初步排查遇到Laravel项目突然显示空白页的情况&#xff0c;相信不少开发者都经历过这种"恐怖时刻"。上周我在部署一个电商项目时也碰到了同样的问题——没有任何错误提示&#xff0c;只有一片雪白的屏幕。这种问题往往让人无从下手&#xff0c;但其实通…

作者头像 李华