用 Ollama 本地运行 Qwen 系列模型:从一条命令拉取到自定义 GGUF 与工具调用

发布时间:2026/9/10 14:38:18

用 Ollama 本地运行 Qwen 系列模型:从一条命令拉取到自定义 GGUF 与工具调用 用 Ollama 本地运行 Qwen 系列模型从一条命令拉取到自定义 GGUF 与工具调用【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5Ollama 让你只需寥寥数条命令即可在本地运行大语言模型支持 macOS、Linux 与 Windows 三大平台。本篇指南以本仓库的 Ollama 官方文档 为主线结合 README.md 中 Qwen3 的最新用法完整讲解如何用一条命令运行 Qwen2.5/Qwen3 系列模型、如何通过Modelfile加载你自己的 GGUF 量化模型以及如何启用工具调用Tool Use读完即可在本地搭建一套开箱即用的 Qwen 推理环境。Ollama 是什么为何适合本地运行 QwenOllama 是一套面向本地推理的模型运行工具把“下载模型、解析 GGUF、执行推理、提供服务”等繁琐环节封装成极简命令。正如 llama.cpp 运行指南 中提到的Ollama 本身就是基于 llama.cpp 生态构建的应用之一底层复用 llama.cpp 的 C 推理引擎与 GGUF 模型格式因此它天然具备 llama.cpp 生态的特性轻量、多平台、支持 CPU 与 GPU 混合推理、支持多种量化方案。注意当前仓库中的 Ollama 文档 头部标注了 “To be updated for Qwen3”待为 Qwen3 更新其正文以 Qwen2.5 为主线而仓库根目录 README.md 已补充了 Qwen3 在 Ollama 上的最新用法。本文两部分都会覆盖请按你所使用的模型代次选择对应章节。Quickstart一条命令运行 Qwen2.5首先访问 Ollama 官方网站并点击下载在你的设备上安装 Ollama支持 macOS、Linux、Windows。你还可以在官网模型库中搜索模型找到 Qwen 系列。安装完成后Qwen2.5 已正式上线 Ollama只需一条命令即可运行默认模型ollama run qwen2.5除了默认规格外你可以通过给模型名追加:尺寸后缀选择运行不同大小的 Qwen2.5-Instruct 模型ollama run qwen2.5:0.5bollama run qwen2.5:1.5bollama run qwen2.5:3bollama run qwen2.5:7bollama run qwen2.5:14bollama run qwen2.5:32bollama run qwen2.5:72b::: note Ollama 不托管基座模型base models。即使模型标签没有instruct后缀它们实际上都是 instruct指令微调模型。 :::运行 Qwen3服务、参数与思考模式开关根据仓库 README.md 的说明Qwen3 同样已正式纳入 Ollama。安装 Ollama 后建议使用 Ollama v0.9.0 或更高版本首先需要启动 Ollama 服务且使用期间需保持该服务运行ollama serve然后在另一个终端中拉取并运行模型。可以通过在qwen3后追加:尺寸后缀来指定模型规格例如:8b或:30b-a3bollama run qwen3:8b在交互式对话中还可以通过斜杠命令调整运行参数与思考模式设置上下文长度与最大生成长度输入/set parameter num_ctx 40960与/set parameter num_predict 32768Qwen3 模型建议配置较长上下文详见下文“上下文管理”部分退出对话输入/bye并回车思考模式开关Qwen3-2504 系列模型/set think—— 启用思考thinking模式这是默认行为/set nothink—— 关闭思考模式。通过 OpenAI 兼容 API 访问Ollama 服务默认提供 OpenAI 兼容接口地址为http://localhost:11434/v1/。使用该 API 前需要保证两点一是ollama serve一直保持运行二是先执行过ollama run qwen3:8b以确保模型检查点已就绪。两个重要的注意事项命名可能与 Qwen 官方不一致Ollama 的命名并不总是与 Qwen 官方命名一致。例如截至 2025 年 8 月Ollama 中的qwen3:30b-a3b实际指向qwen3:30b-a3b-thinking-2507-q4_K_M。使用前请到 Ollama 模型库的qwen3标签页核对实际指向。旋转上下文管理带来的隐患Ollama 与 llama.cpp 一样采用“旋转式上下文管理”rotating context management但其默认参数为num_ctx2048、num_predict-1意味着在 2048 token 的上下文下无限生成这对 Qwen3 模型可能引发问题。因此建议合理设置num_ctx与num_predict如上面/set parameter示例所示。用 Ollama 运行你自己的 GGUF 文件有时你并不想从 Ollama 拉取模型而是希望直接使用自己的 GGUF 文件。GGUF 是 llama.cpp 生态的模型存储格式封装了模型权重、超参数、默认生成配置与分词器等完整信息详见 GGUF 量化指南。假设你已经有一个 Qwen2.5 的 GGUF 文件qwen2.5-7b-instruct-q5_0.gguf步骤如下。第一步编写 Modelfile在本地创建一个名为Modelfile的文件放在 GGUF 文件所在目录内容如下FROM qwen2.5-7b-instruct-q5_0.gguf # set the temperature to 1 [higher is more creative, lower is more coherent] PARAMETER temperature 0.7 PARAMETER top_p 0.8 PARAMETER repeat_penalty 1.05 PARAMETER top_k 20 TEMPLATE {{ if .Messages }} {{- if or .System .Tools }}|im_start|system {{ .System }} {{- if .Tools }} # Tools You are provided with function signatures within tools/tools XML tags: tools{{- range .Tools }} {type: function, function: {{ .Function }}}{{- end }} /tools For each function call, return a json object with function name and arguments within tool_call/tool_call XML tags: tool_call {name: function-name, arguments: args-json-object} /tool_call {{- end }}|im_end| {{ end }} {{- range $i, $_ : .Messages }} {{- $last : eq (len (slice $.Messages $i)) 1 -}} {{- if eq .Role user }}|im_start|user {{ .Content }}|im_end| {{ else if eq .Role assistant }}|im_start|assistant {{ if .Content }}{{ .Content }} {{- else if .ToolCalls }}tool_call {{ range .ToolCalls }}{name: {{ .Function.Name }}, arguments: {{ .Function.Arguments }}} {{ end }}/tool_call {{- end }}{{ if not $last }}|im_end| {{ end }} {{- else if eq .Role tool }}|im_start|user tool_response {{ .Content }} /tool_response|im_end| {{ end }} {{- if and (ne .Role assistant) $last }}|im_start|assistant {{ end }} {{- end }} {{- else }} {{- if .System }}|im_start|system {{ .System }}|im_end| {{ end }}{{ if .Prompt }}|im_start|user {{ .Prompt }}|im_end| {{ end }}|im_start|assistant {{ end }}{{ .Response }}{{ if .Response }}|im_end|{{ end }} # set the system message SYSTEM You are Qwen, created by Alibaba Cloud. You are a helpful assistant.该Modelfile的核心要素指令作用示例取值FROM指定基础 GGUF 文件路径qwen2.5-7b-instruct-q5_0.ggufPARAMETER temperature采样温度越高越有创造性越低越连贯0.7PARAMETER top_p核采样概率阈值0.8PARAMETER repeat_penalty重复惩罚系数1.05PARAMETER top_k采样时保留的最高概率 token 数量20TEMPLATE对话模板Jinja/Go template定义 system、user、assistant、tool 消息如何拼装见上文完整模板SYSTEM默认系统提示词You are Qwen, created by Alibaba Cloud. You are a helpful assistant.注意其中的TEMPLATE采用 Qwen 的 ChatML 风格|im_start|/|im_end|并内嵌了工具调用的 XML 规范tools、tool_call、tool_response标签这是 Qwen 系列支持 function calling 的关键约定与 函数调用指南 中描述的 Hermes 风格工具使用规范一致。模板中还预留了{{ .System }}与{{ .Prompt }}分支以兼容无多轮消息的简易调用场景。第二步创建模型基于Modelfile创建 Ollama 模型ollama create qwen2.5_7b -f Modelfile-f指定 Modelfile 路径qwen2.5_7b是你为该模型起的本地名称之后统一通过这个名字引用它。第三步运行模型创建完成后即可运行ollama run qwen2.5_7b获取与制作 GGUF 文件的补充说明如果你还没有 GGUF 文件仓库文档提供了两条路径详见 llama.cpp 运行指南 与 GGUF 量化指南直接下载官方量化 GGUF通过huggingface-cli拉取例如huggingface-cli download Qwen/Qwen3-8B-GGUF qwen3-8b-q4_k_m.gguf --local-dir .自行转换并量化使用 llama.cpp 的convert-hf-to-gguf.py将 Hugging Face 模型转换为 GGUF再用llama-quantize按Q8_0、Q5_K_M、Q4_K_M等预设压缩位宽必要时可借助 AWQ scale 或 importance matrix 提升低比特量化质量。另外若需要强制关闭思考模式llama.cpp 指南中提到可以传入本仓库提供的 qwen3_nonthinking.jinja 自定义聊天模板等价于始终enable_thinkingFalse在 Ollama 的Modelfile中你也可以用自定义TEMPLATE达到类似目的。工具调用Tool UseOllama 现已支持工具调用Tool Use你可以直接在其上运行支持该能力的 Qwen 模型。工具调用又称函数调用本质上是一种基于提示词工程prompt engineering或模型内置模板的协议应用向模型提供一组函数及其说明模型决定是否调用以及如何传参应用执行函数并把结果回传给模型完成后续交互。上文Modelfile中TEMPLATE内嵌的tools/tool_call/tool_response约定正是这一协议的具体载体。更完整的工具调用实践——包括工具描述如何用 JSON Schema 编写、如何通过 Qwen-Agent 或 vLLM 完成多轮 tool call 闭环、以及 thinking/no_think 两种模式下函数调用结果的结构差异——请参阅本仓库的 函数调用指南。特别提醒对于 Qwen3 这类具备推理能力的模型不建议使用基于 stopword 的 ReAct 式工具调用模板因为模型可能在思考段输出停用词从而干扰工具调用行为。小结在 Ollama 上运行 Qwen 系列模型有三条渐进路径零配置拉取ollama run qwen2.5或ollama run qwen3:8b一条命令体验官方提供的各尺寸指令模型自定义 GGUF编写ModelfileFROMPARAMETERTEMPLATESYSTEM通过ollama create打包成自己的模型并ollama run适合离线环境或需要精细控制采样参数与对话模板的场景工具调用借助 Ollama 的工具调用支持与 Qwen 的tools模板约定将模型接入外部函数与 Agent 应用并可通过http://localhost:11434/v1/的 OpenAI 兼容 API 接入现有代码。结合 README.md 的实践建议运行 Qwen3 时务必注意核对 Ollama 标签指向并通过/set parameter num_ctx与num_predict合理配置上下文避免默认 2048 token 旋转上下文带来的生成质量问题。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/10 14:38:18

Zephyr 日志与追踪实战:3 行 Kconfig 搭出全链路调试通道

Zephyr 日志与追踪实战:3 行 Kconfig 搭出全链路调试通道 【免费下载链接】zephyr Primary Git Repository for the Zephyr Project. Zephyr is a new generation, scalable, optimized, secure RTOS for multiple hardware architectures. 项目地址: https://git…

2026/9/10 14:38:18

51单片机智能饮水机:低成本高可靠嵌入式方案

简介:本资源是一套基于51单片机的智能饮水机系统完整开发工程,面向嵌入式初学者、单片机课程设计学生及电子类实训人员,解决智能温控饮水设备从原理理解到代码实现的全流程学习需求。压缩包共49个文件,包含7个C源文件(…

2026/9/10 15:28:32

CANN/ge性能分析启动接口

aclgrphProfStart 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、TensorFl…

2026/9/10 15:28:32

CANN/GE销毁查询信息接口

aclmdlBundleDestroyQueryInfo 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTor…

2026/9/10 15:28:32

QT事件循环机制与事件处理实战解析

1. QT事件循环机制深度解析 作为QT框架的核心机制,事件循环(Event Loop)承担着应用程序运行中枢的角色。我曾在多个工业控制项目中深刻体会到,不理解事件循环的开发者常会遇到界面卡死、信号槽失效等典型问题。让我们从底层原理开…

2026/9/10 15:23:32

2026年论文降重工具测评与使用指南

1. 论文降重工具的核心价值与选择标准写论文最头疼的就是查重率过高的问题。作为一名经历过无数次论文修改的老手,我深知降重工具的重要性。2026年的今天,市面上涌现出数十款降重工具,但质量参差不齐。真正好用的工具应该具备三个核心能力&am…

2026/9/9 13:11:35

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 0:00:55

目录对比去重实战:用哈希算法精准清理重复文件

我电脑里现在还有一块换了三次机的“数据墓地”硬盘,里面存着2016年以前所有旧笔记本的完整备份。平时不觉得有什么,直到前阵子想把它整理归档,发现同一个安装包、同一批照片、同一份论文草稿,在几个不同的备份目录里反复出现。更…

2026/9/10 0:00:55

Leaflet离线地图完整Demo合集:内网部署与坐标纠偏实战

简介:这是一份面向Web GIS开发者的LeafLet离线地图示例合集,帮助开发者快速掌握离线地图从搭建到交互的完整流程。压缩包共723个文件,大小14.06MB,以319个js脚本、175个html页面和29个css样式文件为主体,配合png/svg图…

2026/9/10 0:00:55

MATLAB读取Rinex 3.02观测文件:多系统GNSS数据解析实战

简介:基于MATLAB开发的Rinex3.02版观测文件(o文件)读取代码包,面向卫星定位导航方向的学习者与研究人员,用于解决新版观测文件的数据解析、历元提取与时间转换问题。压缩包共4个文件,包含两个m脚本、一个19…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/9 10:21:54

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码