GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径

发布时间:2026/9/19 4:53:49

GenieX 使用指南:在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径 GenieX 使用指南在高通骁龙设备上本地运行 LLM 与 VLM 的 6 条路径【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieXGenieX 是面向高通骁龙设备的端侧生成式 AI 推理运行时可以把 Hugging Face 上的 GGUF 模型或 Qualcomm AI Hub 的预编译模型包拉到本地直接跑在 Hexagon NPU、Adreno GPU 或 CPU 上。它底层是同一套 C SDK对外提供 CLI、Python、Android、Docker 和 OpenAI 兼容服务 5 种入口且仅支持骁龙平台。双运行时设计llama.cpp 走覆盖AI Engine Direct 走性能GenieX 内置两套推理后端分别解决能不能跑和跑得多快llama_cpp走高通的 GGML Hexagon 后端可加载 Hugging Face 上几乎任意 GGUF 模型CPU、GPU、NPU 都能跑是模型覆盖最广的路径qairtQualcomm AI Engine Direct只接受按芯片组预编译、预量化的模型包且只跑在 NPU 上换来的是骁龙上最快的 NPU 路径。选哪个取决于模型来源自己手里的 GGUF 用前者AI Hub 上发布的模型用后者。两条路径的详细对比见 平台与运行时文档。骁龙平台支持清单Windows ARM64、Android 与 Linux ARM64GenieX 不做 x86 构建只覆盖三类骁龙设备方向芯片可用入口计算Copilot PC骁龙 X Elite / X2 EliteCLI、Python、本地服务移动骁龙 8 Elite / 8 Elite Gen 5Android SDKKotlin/JavaIoTDragonwing IQ-9075 / IQ-8275CLI、Docker、Python芯片组会自动探测也可用geniex config get chipset确认、geniex config set chipset手动指定。计算单元方面有 4 个别名npu默认、gpu、cpu以及骁龙上速度最快的hybrid——后者把每个算子按 HTP/CPU 各自擅长点分发。模型怎么选GGUF 选 Q4_0 才能上 NPU拉 GGUF 模型时CLI 会让你选精度而精度直接决定模型落在哪块硬件上Q4_0默认llama.cpp 中对 Hexagon NPU 支持最好的格式大多数模型建议选它Q8_0/F16质量更高但体积和耗时约 2 倍通常跑在 GPU/CPU 上AI Hub 模型包量化在编译期就定死多为w4a16运行时无法更改要换精度只能换一个模型包。模态方面文本所有模型都支持图像输入任何 VLM 都行音频输入仅支持 llama.cpp 后端中带 conformer 编码器的 mmproj 模型如google/gemma-4-E2B-it-qat-q4_0-gguf且一次对话可以同时带文本、图片和音频。完整清单见 模型支持文档。从安装到首次推理Linux 一行装好geniex infer 开聊Linux ARM64 上安装 CLI 只需要一行无需 sudocurl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | shWindows ARM64 用户从发行版下载安装包运行即可Python 方向则是pip install geniex另有geniex-llama-cpp、geniex-qairt两个只装单一后端的精简包Android 方向在build.gradle.kts中加入com.qualcomm.qti:geniex-android依赖。装好后一行命令就能和模型对话VLM 直接拖入图片geniex infer google/gemma-4-E4B-it-qat-q4_0-gguf # HF 的 GGUF → llama.cpp geniex infer ai-hub-models/Qwen2.5-VL-7B-Instruct # AI Hub 模型包 → NPUPython 侧的用法对齐 Hugging Face transformers 风格AutoModelForCausalLM.from_pretrained(unsloth/Qwen3.5-2B-GGUF, precisionQ4_0)后调用model.generate(prompt, streamTrue)即可流式输出代码示例见 bindings/python/。OpenAI 兼容服务把本地模型接进 LangChain 等现有应用geniex serve启动一个本地 OpenAI 兼容 API默认监听http://127.0.0.1:18181/v1任何 OpenAI 客户端改个base_url就能复用LangChain 这类 agent 框架同样适用geniex pull ai-hub-models/Qwen3-4B-Instruct-2507 geniex serve服务自带 Swagger UI直接访问http://127.0.0.1:18181端点包括/v1/chat/completions支持 VLM 图文混排与工具调用、面向编辑器代码补全的/v1/completions以及模型列表查询。日常会用到的命令整理如下命令功能geniex pull 模型从 AI Hub / HF / 本地路径拉取模型进缓存geniex infer 模型交互式推理支持--compute、--think、--nctxgeniex serve启动 OpenAI 兼容本地服务geniex list/geniex remove 模型/geniex clean查看 / 删除 / 清空缓存模型geniex-bench独立基准工具测 TTFT、prefill 与 decode 速度用 geniex-bench 实测 NPU 收益从文档与测试入手想知道模型在你设备上真实快多少用独立的geniex-bench工具测三个指标首 token 延迟ttft、prefill 与 decode 速度。官方教程给出的实测参考值骁龙 X Elite 上 Qwen3-1.7BQ4_0的hybrid模式 decode 约 27.4 tok/s比纯 CPU 的 18.5 tok/s 高出 48%Dragonwing IQ-9075 上 22.6 对 15.2 tok/s。工具支持矩阵扫描多种模型 × 设备组合并输出 JSON 报告详见 基准测试教程。仓库内还有这些入口可以深入CLI 命令参考、Python 绑定文档bindings/python/、Android 示例与 集成文档以及覆盖 CLI、两种后端的 测试套件。项目采用 BSD 3-Clause 许可目前处于开发者预览阶段。端侧推理的价值很直接数据不出设备、无网络延迟也没有按 token 计费。下一步建议在你的骁龙设备上装好 CLI跑一条geniex infer ai-hub-models/Qwen3-4B10 分钟内看到第一个本地回答。【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/19 4:53:49

Ansys钣金回弹仿真实战:从机理到U形件补偿

做钣金成型的工程师,十有八九都被回弹折磨过。一付模具试出来,板料从模具里顶出来、侧壁往外张,跟CAD里画的模型完全对不上——轻则差两三度,重则整个轮廓都跑了。材料越硬、强度越高,回弹越明显,这个趋势在…

2026/9/19 4:48:49

嵌入式Linux声音定位系统设计与优化实践

1. 项目背景与核心价值在工业设备监测、环境噪声分析和安防监控等领域,实时声音信号的采集与定位一直是个技术难点。传统方案要么成本高昂,要么精度不足。这个基于嵌入式Linux的系统设计,正好填补了中小型场景下的技术空白。我去年参与过一个…

2026/9/19 4:48:49

Spring AI与LangChain4j双框架Java AI工程化实战

1. 这不是“Java取代Python”的口号,而是工程落地的现实拐点最近在几个技术社区刷到“2026爆火!两大Java AI框架零基础通关”这个标题,第一反应是——又一个标题党?但翻完Spring AI 2.0正式版发布日志、LangChain4j 0.31.0的Chang…

2026/9/19 5:53:51

绕过API限制:OpenClaw实现主流AI网页端直接调用

1. 项目背景与核心价值最近在折腾AI工具时发现一个痛点:很多大模型网页端明明能用,但想集成到自己的项目里就得折腾API。要么要申请权限,要么要处理复杂的鉴权流程,甚至有些服务压根不开放API。OpenClaw这个项目正好解决了这个问题…

2026/9/19 5:53:51

Flutter与OpenHarmony游戏拖尾特效实现与优化

1. 项目概述:Flutter与OpenHarmony下的游戏拖尾特效实现在移动游戏开发中,视觉反馈的即时性和表现力直接影响玩家的游戏体验。轨迹拖尾特效(Trail Effect)作为一种常见的视觉增强手段,能够有效提升动态物体的运动感知。…

2026/9/19 5:53:51

Jetson边缘AI实战复盘:从系统烧录到YOLOv5与Qwen大模型部署全链路

1. 为什么值得做一次系统复盘Jetson边缘嵌入式实战课程走到第十讲,回头把前九讲的内容串一遍,这件事本身就比再学一个新模型更有价值。我见过太多人学Jetson的方式是“东一榔头西一棒槌”——今天跟着教程刷个系统,明天抄个YOLOv5的部署脚本&…

2026/9/19 5:53:51

嵌入式系统第一性原理:从SPI、I2C到DMA的工程实践

嵌入式系统这个领域有个很有意思的现象:很多人能照着教程把外设跑通,但一旦项目换了芯片、换了传感器,或者时序上出了点玄学问题,就完全不知道从哪里下手。我自己带过不少新人,也做过从8位机到Cortex-M7的各种板子&…

2026/9/19 5:48:51

Codex CLI 安装配置全指南:macOS/Windows/IDE 报错排查

1. 先搞清楚:你装的 Codex 到底是哪一层的东西第一次接触 Codex 的朋友,十个里有八个会在“下载哪个、装哪个”上绕弯子。因为 Codex 这个名字现在同时指几样东西:一个是 CLI 命令行工具,可以通过终端和它对话,让它直接…

2026/9/18 14:13:01

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/19 0:03:10

验证 OpenSpec 兼容性,Cursor 的 Token 从 TaoToken 出

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/19 0:03:10

书桌角落的 Mac mini,OpenClaw 通过 TaoToken 跑任务。

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/19 0:03:10

oh-my-hermes:打造跨工具的命令编排与插件化工作流

1. 项目概述与设计初衷1.1 它到底是什么先说结论:oh-my-hermes 是一个面向开发者日常终端操作的效率工具套件,核心定位是“把分散在各类命令行工具里的高频操作,统一收拢成一套插件化、可编排的工作流”。项目灵感来源很明显——oh-my-zsh 重…

2026/9/18 14:13:03

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/18 14:13:02

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/18 14:13:02

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码