Ollama 本地大模型常见问题排查

十年
2026-09-04 / 0 评论 / 2 阅读 / 正在检测是否收录...
加载耗时 17ms

本地跑通 Ollama 之后,新手最常遇到的五个问题及解法,都在这篇里。

1. 下载模型极慢 / 反复失败

Ollama 默认从国外源拉取模型。解决办法:换网络环境重试;或在支持的环境变量里配置代理(HTTPS_PROXY);或从国内镜像站手动下载模型文件后导入(ollama create 从本地文件创建)。

2. 显存不足(Out of Memory)

7B 模型量化版(Q4)大约需要 5~6GB 显存。选择更小的量化版本(如 qwen2.5:7b-instruct-q4_K_M 已是量化版,可换 3B 模型如 llama3.2:3b),或让部分层跑在 CPU 上(Ollama 自动处理,慢一些)。

3. 回复是乱码或复读机式循环

多为模型文件损坏或参数问题。重新 ollama pull;或在调用时降低 temperature(0.7 左右)、设置 repeat_penalty

4. 如何让本地模型联网查资料

Ollama 本身不带联网。两条路:搭配 Open WebUI 的联网插件;或用支持工具调用的模型(如部分 14B 以上模型)配合 Agent 框架。对大多数本地用途(隐私文本处理、离线问答)而言,联网并非必需。

5. 想让本地模型读我的文档

这就是之前讲过的 RAG:Open WebUI 内置"知识库"功能,上传文档后开启检索即可。轻量需求也可以直接在对话里粘贴相关段落。

性能参考

CPU-only 跑 7B:约 3~8 Token/秒(能接受但慢);入门显卡(8GB 显存):20~40 Token/秒;中高端显卡:60+ Token/秒。先跑起来,再谈优化。

本文共 348 个字数,平均阅读时长 ≈ 1分钟
0

评论

博主关闭了当前页面的评论