首页/新闻资讯/正文详情

Ollama :大模型本地部署与轻量化优化

发布时间:2026/9/26 4:14:33 来源:云帆数科 栏目:资讯中心
Ollama :大模型本地部署与轻量化优化
实操可直接看四、九文中地址均为作者的本地地址 实际目录地址自行选择本文档以《Ollama笔记.md》为内容大纲基准参考《课程一基于 Ollama 的大模型本地部署与轻量化优化2 小时体验课讲义》补充操作细节。 本机地址约定Ollama 安装目录C:\Users\20334\AppData\Local\Programs\Ollamallama.cpp 源码目录D:\develop\llama.cpp-master。目录一、Ollama 下载二、Ollama 介绍2.1 什么是 Ollama2.2 为什么要做大模型本地部署2.3 轻量化原理简述三、Ollama 常用命令四、部署、调用某一模型的操作全流程4.1 安装 OllamaWindows 系统MacOS 系统Linux 系统环境验证必做4.2 一键部署模型4.3 调用方式一终端交互式调用4.4 调用方式二本地 HTTP API 调用程序对接必备4.5 调用方式三Python 代码调用开发实操4.6 调用方式四可视化 Web 界面调用Open WebUI五、启用 1 个或多个模型的介绍5.1 核心认知5.2 同一个终端执行多条 ollama run场景一串行输入 → 单模型自动卸载前一个场景二同终端后台并行 → 多模型常驻5.3 多模型并存的资源后果纯 CPU 环境多开不管的后果有 N 卡 GPU 环境多开不管的后果5.4 只跑 Python 代码的场景5.5 最简总结六、模型驻留时间的配置说明、配置优先级说明6.1 控制资源的核心配置6.2 配套实操命令6.3 配置优先级说明七、Opencode 接本地模型的方法说明八、精度说明8.1 模型精度基础8.2 量化类型对照GGUF 格式8.3 多精度量化版本一键切换九、下载模型后量化操作说明完整操作步骤9.1 核心准备工作9.2 步骤 1安装 Python 依赖9.3 步骤 2下载 llama.cpp 转换工具9.4 步骤 3放置下载好的模型9.5 步骤 4将模型转为 FP16 GGUF 基础格式9.6 步骤 5INT4 量化CPU 最优Ollama 推荐9.7 步骤 6编写 Ollama Modelfile 配置文件9.8 步骤 7导入模型到 Ollama9.9 量化部署常见问题Windows 专用9.10 完整流程总结附录常见问题排查讲义补充附录课程核心命令汇总讲义补充一、Ollama 下载官方下载地址Ollama国内镜像地址 Ollama - Ollama 框架安装完成后本机 Ollama 程序位于C:\Users\20334\AppData\Local\Programs\OllamaOllama 安装后默认以后台服务形式常驻本地监听11434端口模型文件默认存储在C:\Users\20334\.ollama\models。models 目录下就两个子文件夹作用如下文件夹作用blobs模型实际数据仓库。所有内容以 sha256-哈希 命名内容寻址包括模型权重、分词器、模板等 layer 数据。同一份数据可被多个模型共享引用实现去重manifests模型清单。按 registry.ollama.ai\library模型名标签 组织每个 .json 记录该模型由哪些 blob 组成digest、大小、类型把模型名映射到blob 集合blobs数据文件GGUF 权重 tokenizer 模板等manifests模型条目 —— 拉取/导入的模型简单理解manifests 是目录索引记录xxx模型 哪几个文件blobs 是实际文件仓库。两者配合ollama 才能用 ollama run 模型名 快速定位并加载模型。二、Ollama 介绍2.1 什么是 OllamaOllama 是一款开源、轻量、跨平台的大模型本地部署工具主打极简操作无需复杂配置环境一条命令即可完成模型的下载、部署、运行、调用完美适配新手入门支持主流开源轻量化模型Qwen、Llama、Hermes 等支持本地私有微调模型自定义导入部署内置 OpenAI 兼容 API 端点http://localhost:11434/v1方便程序与各类客户端对接。2.2 为什么要做大模型本地部署云端部署痛点本地部署优势依赖网络断网即不可用离线可用部署完成后无需联网输入内容需上传云端有隐私风险隐私安全对话数据仅在本地运行有调用次数限制与 API 费用低成本无限制无调用费用、无次数限制难以自由调试可定制优化支持轻量化、参数调优、私有模型落地2.3 轻量化原理简述原生大模型参数规模庞大数十亿、上百亿参数文件体积可达几十 GB 甚至上百 GB普通个人电脑无法直接运行。轻量化优化指在基本不损失模型效果的前提下压缩模型体积、降低内存与算力占用。三大模型压缩技术量化核心降低参数数值精度FP32/FP16 → INT8/INT4大幅缩小体积、提升推理速度剪枝剔除网络中贡献小的冗余权重、神经元或通道精简网络结构知识蒸馏用高精度大模型教师的输出知识训练轻量化小模型学生。三、Ollama 常用命令# 查看版本号验证安装是否成功 ollama --version ​ # 拉取下载模型 ollama pull 模型名 ​ # 运行模型未下载则自动下载下载后自动加载并进入 交互对话 ⭐⭐⭐⭐⭐ ollama run 模型名 ​ # 查看已安装的模型列表 ollama list ​ # 查看当前正在运行的模型 ollama ps ​ # 停止指定模型的运行释放内存/显存资源 ollama stop 模型名 ​ # 删除模型释放磁盘空间 ollama rm 模型名 ​ # 用 Modelfile 创建自定义模型用于参数调优、导入 GGUF 模型 ollama create 自定义模型名 -f Modelfile ​ # 手动启动后台服务默认常驻一般无需执行 ollama serve四、部署、调用某一模型的操作全流程以模型Qwen1.5-0.5B-ChatOllama 库 tagqwen:0.5b为例走通安装 → 部署 → 四种方式调用全流程。4.1 安装 OllamaWindows 系统打开官网 Ollama 点击Download for Windows下载安装包双击 exe 安装包默认路径安装即可本机默认安装目录C:\Users\20334\AppData\Local\Programs\Ollama安装完成后系统自动启动 Ollama 后台服务。MacOS 系统官网下载Download for macOS的 dmg 安装包将 Ollama 拖入应用程序打开即可自动配置环境。Linux 系统终端输入一键安装命令curl -fsSL https://ollama.com/install.sh | sh环境验证是否安装成功必做终端输入ollama --version输出版本号即安装成功若提示不是内部命令重启终端或重新安装Windows 需确认安装时已添加环境变量。4.2 一键部署模型# 第一步先拉取模型约 500MB体积极小、下载极快 ollama pull qwen:0.5b ​ # 第二步运行模型自动加载并进入交互对话 ollama run qwen:0.5b部署过程说明首次运行会自动下载模型文件约 500MB下载完成后自动加载模型终端出现交互提示符即部署成功全程无需手动配置环境、无需显卡CPU 自动调度运行。拉取机制说明拉取的是Ollama 官方模型库Library中存在的模型你可以在 ollama.com/search 搜索到有哪些模型ollama pull 实际下载地址不是网页本身而是 Ollama 的模型注册中心registry默认从 registry.ollama.ai 拉取镜像文件GGUF 格式。网页只是模型目录/文档页命令走的是 registry 下载通道。国内网络可换镜像源如果你直接 pull 速度慢或失败可以配置国内镜像 https://ollama.ac.cn讲义中也提到过该地址例如:: 设置镜像源后重新拉取 set OLLAMA_HOSThttps://ollama.ac.cn ollama pull qwen:0.5b或者通过修改注册表/环境变量指向镜像地址之后再 ollama pull 就能加速下载。所以流程是网页负责选模型、看说明ollama pull 负责从 registry 下载两者对应同一个模型库。4.3 调用方式一终端交互式调用模型启动后出现提示符直接输入问题即可对话 你好请介绍一下本地大模型部署 写一段AI课程学习心得 解释模型量化的作用退出对话命令/bye4.4 调用方式二本地 HTTP API 调用程序对接必备Ollama 安装后默认常驻本地服务http://localhost:11434支持离线 API 调用。# 生成接口测试Windows 下 curl 需转义双引号 curl http://localhost:11434/api/generate -d {\model\:\qwen:0.5b\,\prompt\:\写一句AI课程欢迎语\,\stream\:false} ​ # 查看本地所有已安装模型的 API 列表 curl http://localhost:11434/api/tags4.5 调用方式三Python 代码调用开发实操先安装依赖pip install requests完整可运行代码import requests ​ # 本地Ollama接口地址 url http://localhost:11434/api/generate ​ # 请求参数配置j data { model: qwen:0.5b, prompt: 请简单介绍Ollama本地部署的优势, stream: False } ​ # 发送请求并获取结果 response requests.post(url, jsondata) result response.json() ​ # 打印AI回复 print(AI回复, result[response])4.6 调用方式四可视化 Web 界面调用Open WebUI通过 Open WebUI 搭建类 ChatGPT 网页界面操作更直观。操作顺序启动 Docker Desktop →ollama run qwen:0.5b→ WebUI 起服务。# 官方镜像一键部署 docker run -d -p 3000:3000 --name open-webui ghcr.io/open-webui/open-webui:main ​ # 南大镜像国内网络更稳定 docker run -d -p 3000:3000 --name open-webui ghcr.nju.edu.cn/open-webui/open-webui:main浏览器访问http://localhost:3000自动关联本地 Ollama 所有模型。五、启用 1 个或多个模型的介绍5.1 核心认知Ollama 是单服务进程11434 端口全局共用。不管开几个终端底层都是共用同一套 Ollama 后台调度只分两种用法ollama run 模型名交互式对话Python/代码调用 API自动按需加载模型。5.2 同一个终端执行多条ollama run场景一串行输入 → 单模型自动卸载前一个ollama run qwen:0.5b :: 退出对话/bye之后再输入 ollama run llama3:1b原理交互式 run 独占终端会话前一个模型退出才释放再加载新模型资源后果同一时间内存/显存永远只存 1 个模型无爆内存风险。场景二同终端后台并行 → 多模型常驻:: Windowscmd 用 start /b 后台启动 start /b ollama run qwen:0.5b start /b ollama run llama3:1b ​ :: Linux/macOS用 后台运行 ollama run qwen:0.5b ollama run llama3:1b 此时两个模型同时加载进内存/显存效果与开两个独立终端完全一致ollama ps能查到两个运行中的模型。5.3 多模型并存的资源后果纯 CPU 环境多开不管的后果所有模型占用物理内存 RAM多个模型内存占用累加无内存共享8G 内存机器开 3 个小模型 → 内存占满、系统疯狂读写虚拟内存、整机卡顿后续再调用新模型Ollama 按LRU最近最少使用淘汰闲置最久的模型导致频繁重载、首句推理几十秒代码 API 请求会排队、超时、内存报错。有 N 卡 GPU 环境多开不管的后果显存余量充足全部载入显存推理速度正常显存持续被占用显存不够新模型自动溢出到系统内存一半 GPU 一半 CPU 混合推理速度暴跌 5~20 倍显存彻底打满OOM 报错自动踢出闲置模型下次调用重新加载若代码设置keep_alive: -1永久驻留显存永久占用不自动释放必须手动ollama stop。5.4 只跑 Python 代码的场景全程只在一个终端运行 Python 脚本时不需要开ollama runAPI 自动按需加载模型这是最常用场景。# 同一份代码反复换 model 名称、多脚本并发调用全部共用 11434 服务 data {model: qwen:0.5b, keep_alive: 1m} requests.post(http://localhost:11434/api/generate, jsondata) ​ # 再改 modelllama3:1b 再次请求多个模型可同时驻留默认规则OLLAMA_MAX_LOADED_MODELS默认 3后台自动缓存已调用模型多次调用不同模型会同时驻留多个在内存/显存不受终端数量限制只受硬件 环境变量限制。不做管控的后果CPU 端反复切换多种模型全部常驻内存RAM 逐步占满、系统变卡、swap 狂读闲置超时默认 5 分钟才自动卸载期间资源一直占用GPU 端多模型全进显存显存慢慢耗尽后续新模型落 CPU 运行若配置keep_alive: -1模型永久挂在显存、永不自动释放不手动 stop 永远占卡。5.5 最简总结同终端串行ollama run永远单模型无资源爆炸风险同终端后台并行 run / Python 频繁切换多 model和多终端效果一致多模型同占内存/显存CPU 怕多开爆内存、GPU 怕多开爆显存不管keep_alive-1会永久锁资源稳妥方案代码配keep_alive1m 启动脚本前设置OLLAMA_MAX_LOADED_MODELS1。六、模型驻留时间的配置说明、配置优先级说明6.1 控制资源的核心配置配置 1keep_alive代码内设置优先级最高取值含义适用0用完即清立即释放低配机推荐1m闲置 1 分钟释放测试推荐-1永久常驻必须手动 stop不推荐滥用在 API 请求 JSON 中传入keep_alive: 1m可覆盖环境变量。配置 2OLLAMA_MAX_LOADED_MODELS环境变量全局管控并行加载数:: 全局最多同时加载 2 个模型超出自动淘汰旧模型 set OLLAMA_MAX_LOADED_MODELS2 python demo.py设1任何场景同一时间只保留 1 个模型调用新模型自动卸载旧的杜绝多开爆资源低配电脑必加。6.2 配套实操命令:: 设置 1 分钟自动释放 set OLLAMA_KEEP_ALIVE1m ​ :: 设置 5 分钟恢复默认 set OLLAMA_KEEP_ALIVE5m ​ :: 设置永久驻留必须手动 stop set OLLAMA_KEEP_ALIVE-1 ​ :: 查看当前环境变量值 echo %OLLAMA_KEEP_ALIVE%CPU 环境无显卡专用配置:: 最多同时加载1个模型 set OLLAMA_MAX_LOADED_MODELS1 ​ :: 使用4个CPU线程 set OLLAMA_NUM_THREADS4 ​ :: 强制禁用GPU set CUDA_VISIBLE_DEVICESGPU 环境有 N 卡专用配置:: 自动使用GPU默认就是这个 set CUDA_VISIBLE_DEVICES0 ​ :: 模型加载到显存不占内存 set OLLAMA_GPU_LAYERS99 ​ :: 最多同时加载2个模型 set OLLAMA_MAX_LOADED_MODELS2运行状态查看与资源释放# 查看当前常驻所有模型不分终端来源 ollama ps ​ # 一键释放指定模型 ollama stop qwen:0.5b6.3 配置优先级说明代码内keep_alive 环境变量OLLAMA_KEEP_ALIVE 系统默认值5 分钟配置层级生效范围优先级API 请求中的keep_alive单次请求最高OLLAMA_KEEP_ALIVE环境变量全局中Ollama 内置默认闲置 5 分钟自动卸载兜底低OLLAMA_MAX_LOADED_MODELS全局并行模型数量上限与驻留时间配置相互配合七、Opencode 接本地模型的方法说明Opencode 是 AI 编程终端工具通过自定义 Provider 对接 Ollama 的 OpenAI 兼容端点http://localhost:11434/v1。前置条件# 1. 确认 Ollama 服务运行中默认端口 11434 # 2. 拉取一个代码模型如 qwen2.5-coder ollama pull qwen2.5-coder:14b ​ # 3. 验证 OpenAI 兼容端点可用 curl http://localhost:11434/v1/models # 期望返回 {object:list,data:[{id:qwen2.5-coder:14b,...}]}配置文件位置全局%USERPROFILE%\.config\opencode\opencode.json本机即C:\Users\20334\.config\opencode\opencode.json项目级当前项目根目录下的opencode.json优先级更高不确定时运行opencode debug paths查看。核心 Provider 配置在 opencode.json 中写入{ $schema: https://opencode.ai/config.json, model: ollama/qwen2.5-coder:14b, provider: { ollama: { npm: ai-sdk/openai-compatible, name: Ollama (local), options: { baseURL: http://localhost:11434/v1 }, models: { qwen2.5-coder:14b: { name: Qwen2.5 Coder 14B (local) } } } } }关键字段说明字段说明ollamaProvider ID需与model字段的ollama/前缀一致npm适配器包固定为ai-sdk/openai-compatibleoptions.baseURL本地端点必须以/v1结尾漏掉会 404models模型 ID 映射key 必须与ollama pull的模型名完全一致验证生效保存配置后完全退出并重启Opencode在 Opencode 内执行/models看到Ollama (local)分类下的本地模型即可选中对话。常见排错/connect中没有本地选项属正常本地 Ollama 不走 API key必须在opencode.json中声明 provider404/连不上确认baseURL以/v1结尾、Ollama 正在运行工具调用不稳定本地模型上下文过小可用 Modelfile 将num_ctx提高到 16k~32k 后重建模型。八、精度说明8.1 模型精度基础量化原理是降低模型参数的数值精度原生模型多为 FP16/FP32 高精度浮点存储量化后转为 INT8/INT4 低精度存储大幅缩小模型体积、提升推理速度。精度体积速度精度表现适用场景FP32全精度最大最慢最高服务器/显卡充足环境FP16半精度大较慢很高原生模型常见格式INT8 量化体积减半提升轻微损耗日常无感知通用均衡选择INT4 量化体积压缩 75%大幅提升小幅损耗最适配普通 CPU 设备8.2 量化类型对照GGUF 格式量化类型体积速度精度用途Q2_K极小最快较差极限压缩、仅演示Q3_K_M极小最快一般超小模型、演示Q4_K_M小快很好生产/教学首选Q4_0小快较好最古老 4bit 量化通用Q5_K_M中较快优秀对话质量要求高Q8_0大较慢极高近乎原生量化等级/格式只是算法不同、精度不同、速度不同同一模型可产出多个量化版本按需选用。8.3 多精度量化版本一键切换Ollama 支持一键切换不同量化版本根据电脑内存选择适配模型量化版本模型体积硬件要求特点qwen1.5:0.5b-chat原生版500MB 左右4G 内存即可运行体积极小、秒级响应满足基础 AI 对话需求qwen1.5:0.5b-chat-q4_04 位量化300MB 左右2G 及以上内存极致压缩、超低资源占用老旧低配电脑专属优化qwen1.5:0.5b-chat-q8_08 位量化400MB 左右4G 及以上内存精度最优、几乎无效果损耗流畅度与效果均衡低配设备卡顿优化# 切换为极致轻量化 4 位量化版本 ollama run qwen1.5:0.5b-chat-q4_0自定义轻量化参数调优Modelfile新建无后缀文件modelfile写入FROM qwen:0.5b # 限制最大上下文长度降低内存占用 PARAMETER num_ctx 2048 # 匹配CPU核心数优化推理速度 PARAMETER num_thread 4 # 调整生成随机性数值越低回答越精准 PARAMETER temperature 0.7构建并运行# 根据 modelfile 创建自定义模型 ollama create light-qwen -f modelfile ​ # 运行自定义模型 ollama run light-qwen参数解析num_ctx越小、num_thread越少设备占用越低、运行越流畅temperature越低回答越精准。运行优化小技巧运行模型时关闭多余后台软件释放内存低配设备优先选择 Q4_0 量化版本优先保证流畅度长期不用模型执行ollama stop 模型名释放设备资源。九、下载模型后量化操作说明完整操作步骤更常用的是直接从huggingface上下载量化好的模型如qwen2.5-coder-14b-gguf然后写Modelfile然后导入详情可见我的另外一篇文章基于 Ollama 部署 qwen2.5-coder-14bGGUF 直下版-CSDN博客注意谨慎pip install -U huggingface_hub这是把该包升级到最新版本但可能会造成与其它库包的版本冲突。可先查看是否已有该包通过9.2 步骤 1安装 Python 依赖 就已经直接下载huggingface_hub 版本1.x.x)可以使用pip check检查某环境中是否存在库包的版本冲突目标将下载的模型转为GGUF → INT4 量化 → Modelfile 导入 Ollama 部署调用。说明模型自行从网页上下载HuggingFace 等llama.cpp 为官方模型转 GGUF 与量化工具。本机路径llama.cpp 源码位于D:\develop\llama.cpp-master。9.1 核心准备工作模型文件夹完整包含config.json、model.safetensors/pytorch_model.bin、tokenizer等全部文件自行从网页下载系统要求Windows 10/11已安装 Python 3.10Ollama已安装并正常运行本机目录C:\Users\20334\AppData\Local\Programs\Ollama。9.2 步骤 1安装 Python 依赖打开 CMD 或 PowerShell可在虚拟环境中执行pip install torch transformers sentencepiece protobuf ggufgguf包是convert_hf_to_gguf.py脚本的必需依赖缺失会报ModuleNotFoundError: No module named gguf。9.3 步骤 2下载 llama.cpp 转换工具llama.cpp 是官方模型转 GGUF 工具分两步准备先 Git 克隆源码再下载编译好的 Windows 版本解压进去两步配合使用第 1 步Git 克隆源码源码自带convert_hf_to_gguf.py转换脚本这是转 GGUF 必需的工具本机已放置于D:\develop\llama.cpp-mastergit clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp :: 本机路径D:\develop\llama.cpp-master第 2 步下载编译好的 Windows 版本并解压到上述 Git 目录Windows 直接用编译好的版本不用自己编译里面自带llama-quantize.exe量化工具打开下载地址https://github.com/ggerganov/llama.cpp/releases下载哪一个版本根据自己电脑的实际配置选择解压到第 1 步 Git 克隆的目录下本机D:\develop\llama.cpp-master让解压出的 exe 与源码文件在同一目录便于后续统一执行命令。这样配置后convert_hf_to_gguf.py源码自带用于转 GGUF与llama-quantize.exezip 提供用于量化就齐了解压到同一目录便于后续在当前目录直接执行命令。这样两步缺一不可原因在于两个工具所在位置不同git clone 源码convert_hf_to_gguf.py把 HuggingFace 模型转成 GGUF 格式的转换脚本只存在于源码仓库里Releases 的 zip 包里没有所以必须先拉源码才能拿到转换脚本。下载 llama-bin-win-x64.zip 解压进去量化工具 llama-quantize.exe 是编译好的二进制不在源码里源码里只有需要自己编译的 .cpp 源文件直接从 Releases 下载现成的 exe 解压到源码目录就省去了自己编译的麻烦。解压到同一个目录的原因也很直接后续执行python convert_hf_to_gguf.py ./qwen3-4b-finetune --outtype f16 --outfile qwen3-4b-finetune-f16.gguf .\llama-quantize.exe qwen3-4b-finetune-f16.gguf qwen3-4b-finetune-int4.gguf Q4_K_M时两个命令在当前目录就能直接找到对应工具不用写一堆绝对路径。9.4 步骤 3放置下载好的模型在D:\develop\llama.cpp-master\下新建子文件夹如qwen3-4b-finetune将下载的完整模型全部复制进去最终路径D:\develop\llama.cpp-master\qwen3-4b-finetune\文件夹内必须有config.json、tokenizer_config.json、模型权重文件model.safetensors或pytorch_model.bin。9.5 步骤 4将模型转为 FP16 GGUF 基础格式在D:\develop\llama.cpp-master\目录下打开 CMD/PowerShell执行# 命令格式 python convert_hf_to_gguf.py [被转换文件的相对路径] --outtype [输出精度] --outfile [转换后的文件名] ​ # 示例 python convert_hf_to_gguf.py ./qwen3-4b-finetune --outtype f16 --outfile qwen3-4b-finetune-f16.gguf执行成功后生成D:\develop\llama.cpp-master\qwen3-4b-finetune-f16.gguf--outtype 是输出精度参数f16 是最常用的取值。--outtype 支持的取值convert_hf_to_gguf.pyf16半精度浮点最常用中间格式模型权重本身多为 FP16f32全精度文件更大约 32GB一般不必要bf16bfloat16部分模型支持q8_08-bit 量化可直接输出量化格式tq1_0 / tq2_0三值量化实验性auto自动按模型原始权重精度选择使用建议做量化链路时中间产物用 f16或 auto保证后续 llama-quantize 从高精度量化质量最好9.6 步骤 5INT4 量化CPU 最优Ollama 推荐继续在当前目录执行量化命令# 命令格式llama-quantize.exe 输入.f16.gguf 输出.gguf 【量化类型】 llama-quantize.exe qwen3-4b-finetune-f16.gguf qwen3-4b-finetune-q4_K_M.gguf Q4_K_M量化类型示例# q4_0最古老的 4bit 量化 llama-quantize.exe qwen1.5-0.5b-finetune-f16.gguf qwen1.5-0.5b-ft.int4.gguf q4_0 ​ # Q3_K_M超小体积量化 llama-quantize.exe qwen1.5-0.5b-finetune-f16.gguf qwen1.5-0.5b-finetune-q3_K_M.gguf Q3_K_M ​ # Q4_K_M生产/教学首选本机 8B 模型示例 llama-quantize.exe qwen3-8B-finetune-f16.gguf qwen3-8B-finetune-q4_K_M.gguf Q4_K_M✅ 最终得到可用的INT4 量化模型D:\develop\llama.cpp-master\qwen3-4b-finetune-q4_K_M.gguf9.7 步骤 6编写 Ollama Modelfile 配置文件在D:\develop\llama.cpp-master\目录下新建文本文档重命名为Modelfile无后缀名必须去掉 .txt打开 Modelfile写入以下内容FROM指向量化后的 gguf 文件# 加载本地 INT4 量化模型相对路径基于 Modelfile 所在目录 FROM ./qwen3-4b-finetune-q4_K_M.gguf ​ # 运行参数 PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 4096 ​ # 对话模板Qwen 系 ChatML 格式 TEMPLATE {{if .System}}|im_start|system {{.System}}|im_end|{{end}}|im_start|user {{.Prompt}}|im_end| |im_start|assistant PARAMETER stop |im_end| ​ # 自定义系统提示可修改 SYSTEM 你是基于微调后的Qwen3-4B大模型回答专业、简洁、准确。ollama create 通过 -f 参数指定 Modelfile 路径文件名不限.txt 后缀也行只是建议去掉后缀保持规范。两种用法默认名 Modelfileollama create 模型名自动找当前目录的 Modelfile可省略 -f自定义名如 Modelfile-ft-q4ollama create 模型名 -f Modelfile-ft-q49.8 步骤 7导入模型到 Ollama# 命令格式ollama create [导入到Ollama中的模型名] -f [Modelfile文件] ollama create finetune-int4 -f Modelfile导入多个量化版本示例ollama create finetune-int4 -f Modelfile-ft-q4 ollama create finetune-int3 -f Modelfile-q3km验证导入结果ollama list看到finetune-int4即部署完成随后即可用常规方式调用ollama run finetune-int4注意将模型导入到Ollama后两个中间产物转FP16 GGUF、量化的产物可以删除但建议保留量化后的产物因为如果后续修改配置文件然后重新导入该模型会使用到量化后的产物FROM ./qwen3-4b-finetune-q4_K_M.gguf。为什么可以删ollama create 时会把 GGUF复制一份进 .ollama\models\blobs内容寻址存储。模型运行时读的是 blobs 里的副本不依赖原路径文件9.9 量化部署常见问题Windows 专用问题解决方案报错不是内部命令确保在 llama.cpp 解压目录本机D:\develop\llama.cpp-master下执行命令转换失败模型路径必须纯英文、无空格、无中文量化失败使用官方发布的llama-quantize.exe不要自己编译Ollama 导入失败检查 Modelfile 无后缀名、FROM模型路径写对9.10 完整流程总结核心流程模型下载 → 转 FP16 GGUF → INT4 量化 → Modelfile 配置 → Ollama 导入Windows 先 Git 克隆 llama.cpp 源码再把编译好的llama-bin-win-x64.zip解压进同一目录最省心最终得到小体积、CPU 流畅运行的私有模型支持离线调用。附录常见问题排查讲义补充报错现象解决方案ollama 不是内部/外部命令安装后未重启终端重启终端即可Windows 需确认安装时添加了环境变量模型下载失败/中断网络波动导致重新执行ollama run即可Ollama 支持断点续传设备卡顿、响应极慢更换更低精度量化模型Q2_K/Q4_0调低num_ctx参数关闭后台进程内存不足加载失败4G 及以下内存设备优先使用 Q4_0 量化轻量化版本微调模型导入失败检查路径是否含中文、确认模型已成功转为 GGUF 格式、Modelfile 配置无误附录课程核心命令汇总讲义补充# 环境验证 ollama --version ​ # 部署运行原生 Qwen 0.5B 对话模型 ollama run qwen:0.5b ​ # 部署运行极致轻量化 4 位量化版本低配设备专用 ollama run qwen1.5:0.5b-chat-q4_0 ​ # 查看已安装模型 ollama list ​ # 停止模型运行 ollama stop 模型名 ​ # 删除模型释放空间 ollama rm 模型名 ​ # 自定义轻量化模型构建 ollama create 自定义模型名 -f modelfile ​ # 微调模型部署核心命令 # 模型量化在 D:\develop\llama.cpp-master 目录下执行 llama-quantize.exe 输入.f16.gguf 输出.gguf 【量化类型】 # 导入微调模型 ollama create 微调模型名 -f Modelfile

相关推荐

2026中小企业进销存系统选型指南:6款热门软件横向对比与最终推荐
2026中小企业进销存系统选型指南:6款热门软件横向对比与最终推荐

1. 2026年中小企业进销存选型,先看清这三个变化1.1 选型决策从"单点好用"变成"整体协同"前几年我问客户需求,听到最多的回答是"能开单、能查库存就行"。但从去年开始,明显感觉到老板们的关注重点变了——他们开… · 2026/9/26 4:14:33

L2、分类攻击应用于reid等相关理解
L2、分类攻击应用于reid等相关理解

一、L2范数L2-norm 欧几里得范数/2-范数 向量元素的平方和的平方根L2-normalized L2归一化 (L2用于模长的计算) 在几何学中,衡量两个向量之间方向夹角远近的标准数学公式是余弦相似度(Cosine Similarity):向量除以模长… · 2026/9/26 4:14:33

EHR数据补全实战:从缺失机制到智能优化算法的完整技术链路
EHR数据补全实战:从缺失机制到智能优化算法的完整技术链路

简介:面向备战2026年江西省研究生数学建模竞赛的团队,这套资源围绕题2电子健康记录数据补全与优化算法,提供从问题拆解到成果输出的完整闭环。论文部分内置特等奖标准模板,摘要、问题重述、模型假设、符号说明、模型建立与求解、灵… · 2026/9/26 4:14:33

Gh0st 3.6源码编译与协议改造实战指南
Gh0st 3.6源码编译与协议改造实战指南

简介:本资源为Gh0st远程控制软件3.6版本的完整可编译源码包,面向网络安全研究人员、逆向分析学习者及C/C#底层开发人员,用于深入理解远程控制工具的通信机制、客户端-服务端架构与网络编程实现。压缩包为ZIP格式,大小909KB&#x… · 2026/9/26 4:58:42

灵活用工是什么,为什么企业降本增效离不开它
灵活用工是什么,为什么企业降本增效离不开它

灵活用工是什么,为什么企业降本增效离不开它你有没有遇到过这样的困境?电商大促期间急需上百名临时主播,但真人成本高、排班难;或是有一批自由职业者完成项目后,发佣金时却拿不到合规发票,年底做账头疼不已… · 2026/9/26 4:58:42

PICO4 VR三维模型实时剖切:Unity CrossSection切片器实现指南
PICO4 VR三维模型实时剖切:Unity CrossSection切片器实现指南

这期学习记录讲一个上手很快、但坑也不算少的活儿:在PICO4一体机上,用Unity做一把能实时剖开三维模型的“虚拟切片器”,也就是在VR里所见即所得地显示物体内部的截面。项目背景是朋友那边接了一个医疗器械教学演示,需要把血管介入… · 2026/9/26 4:58:36

PICO4 VR切片器实战:基于CrossSection的Unity切割与截面生成
PICO4 VR切片器实战:基于CrossSection的Unity切割与截面生成

1. 为什么要做切片器:VR里“看不见的内部”才是刚需先聊一个很多Unity开发者在做PICO4项目时都会撞上的需求:用户想“看穿”物体内部。不管是机械拆解的教学演示、医学CT影像的三维查看,还是数字孪生里的设备检修模拟,都需要把外壳… · 2026/9/26 4:58:36

冬风苍叶舞:从植物宿存到流体力学,探秘冬季落叶之美
冬风苍叶舞:从植物宿存到流体力学,探秘冬季落叶之美

十一月末的傍晚,我在河边绿化带里站了十几分钟,纯粹是被一棵白蜡树留住的。北风一阵一阵地来,树上剩的那十几片复叶就一阵一阵地疯舞,从枝头松开之后顺着风势向上翻,划出几道弧线,最后落在我的鞋面上。旁边… · 2026/9/26 4:58:36

鸿蒙上跑RN:RNOH环境搭建与启动白屏排障实录
鸿蒙上跑RN:RNOH环境搭建与启动白屏排障实录

前阵子接了一个智能硬件项目,要在 OpenHarmony 设备上跑一套现有的 React Native 业务代码。调研了一圈,社区方案里最成熟的还是 React Native for OpenHarmony(后面统一叫 RNOH)。这个项目本质上就是把 React Native 的 JS 运行时… · 2026/9/26 4:58:36

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码