本地跑通 Ollama 之后,新手最常遇到的五个问题及解法,都在这篇里。
1. 下载模型极慢 / 反复失败
Ollama 默认从国外源拉取模型。解决办法:换网络环境重试;或在支持的环境变量里配置代理(HTTPS_PROXY);或从国内镜像站手动下载模型文件后导入(ollama create 从本地文件创建)。
2. 显存不足(Out of Memory)
7B 模型量化版(Q4)大约需要 5~6GB 显存。选择更小的量化版本(如 qwen2.5:7b-instruct-q4_K_M 已是量化版,可换 3B 模型如 llama3.2:3b),或让部分层跑在 CPU 上(Ollama 自动处理,慢一些)。
3. 回复是乱码或复读机式循环
多为模型文件损坏或参数问题。重新 ollama pull;或在调用时降低 temperature(0.7 左右)、设置 repeat_penalty。
4. 如何让本地模型联网查资料
Ollama 本身不带联网。两条路:搭配 Open WebUI 的联网插件;或用支持工具调用的模型(如部分 14B 以上模型)配合 Agent 框架。对大多数本地用途(隐私文本处理、离线问答)而言,联网并非必需。
5. 想让本地模型读我的文档
这就是之前讲过的 RAG:Open WebUI 内置"知识库"功能,上传文档后开启检索即可。轻量需求也可以直接在对话里粘贴相关段落。
性能参考
CPU-only 跑 7B:约 3~8 Token/秒(能接受但慢);入门显卡(8GB 显存):20~40 Token/秒;中高端显卡:60+ Token/秒。先跑起来,再谈优化。
本文共 348 个字数,平均阅读时长 ≈ 1分钟
评论