Skip to content

Ollama 模型库与模型选择

本章节将横向梳理 Ollama 模型库的阅读方法、主流模型家族的定位、量化精度的权衡,最终给你一套按任务选型的实用方法。

模型选对了,一半的性能问题就不存在了。


模型库怎么读:能力标签体系

Ollama 模型库(ollama.com/search)用标签体系标注每个模型的能力,选模型第一步就是按标签过滤。

runoob1787976155190.png

标签含义典型用途
vision支持图像输入看图问答、截图理解、文档识别
tools支持工具调用Agent、函数调用、自动化
thinking支持思考模式数学、逻辑、复杂推理
embedding文本转向量RAG、语义搜索、知识库
cloud云端运行,无需本地算力本地配置不足时调用大模型

以本教程的 qwen3.5 为例,它在模型库中同时带有 vision、tools、thinking 标签,属于"全能型"选手,这也是全书选它做测试模型的原因。

每个模型页还会列出全部标签(tag)、下载体积、上下文窗口、输入类型和更新时间,下载前花一分钟读完,能省下大量试错时间。


主流模型家族一览

Ollama 不是模型,而是运行各家开源模型的平台。下面是当前最常见的几个家族:

家族出品方定位特点适合场景
Qwen(通义千问)阿里巴巴规格齐全,中文能力强,多模态与工具调用完整中文任务、通用开发、本教程示例
DeepSeek深度求索推理系列(R1)以思考链见长数学、逻辑、需要深度推理的任务
GemmaGoogle轻量规格表现出色,多模态低配设备、轻量任务
LlamaMeta生态最广,社区资料多通用任务、英文场景
GPT-OSSOpenAIOpenAI 的开源系列,支持思考档位通用任务、Agent 实验
MistralMistral AI欧洲阵营代表,小模型效率高轻量部署、多语言

模型迭代速度以周计,具体可用的规格和能力以模型库实时页面为准。选型思路比具体结论更长寿:先定任务和能力标签,再看规格与硬件的匹配。


量化精度:体积与质量的权衡

量化是把模型权重从高精度小数压缩成低位宽存储的技术,是"大模型跑进小显卡"的关键。

同一模型的不同量化版本,体积和质量关系大致如下:

精度相对体积质量表现适用场景
fp16 / fp32基准(最大)无损训练、量化前的原始权重
q8_0约 1/2几乎无损显存充裕时的优选
q4_K_M约 1/4小幅下降,性价比最高绝大多数本地部署的选择
q4_K_S略小于 q4_K_M比 q4_K_M 再低一点极限压榨显存

模型库里的模型默认已经量化好(常见为 q4_K_M),下载即用,不需要自己操心。

想确认某个本地模型的实际精度,用 show 系列接口或 API 都能查到量化等级;想亲手把一个 fp16 模型压成小体积,用 create 命令的 quantize 参数即可,下一篇 Modelfile 章节有完整演示。


按任务选模型

把"选模型"变成一道分类题:先确定任务,再对照推荐。

task-model-tree.svg

任务推荐模型硬件参考备注
日常对话、写作qwen3.5:4b ~ 9b16GB 内存可跑性价比首选,能力标签全
代码生成qwen3-coder建议 24GB 以上显存配合编码工具需 64K 上下文
数学、逻辑推理deepseek-r1 / qwen3.5 思考模式按规格常规配置开启 think 后更稳但更慢
看图、截图理解qwen3.5(原生视觉)与对话规格一致命令行直接传图片路径
RAG、语义搜索embeddinggemma / qwen3-embedding体积小,要求低嵌入模型不能用来聊天

嵌入(embedding)模型和生成模型是两类东西:前者只把文本变成向量,用于检索和相似度计算,不会输出文字回答。搭建知识库时两者都要有,别混用。


体积与硬件匹配

排除法比记忆法好用:先用一条粗略规则判断"跑不跑得动",再微调。

粗略规则:模型下载体积约等于最低内存/显存需求,实际运行再预留 1~2GB 开销,上下文窗口越大追加越多。

你的可用内存 / 显存能跑的规格上限建议
8GBqwen3.5:0.8b ~ 2b体验为主,接受能力上限
16GBqwen3.5:4b ~ 9b日常使用甜点位
8GB 显存(独立显卡)qwen3.5:9b保持 100% GPU 才有速度
24GB 显存qwen3.5:27b / qwen3-coder进阶开发与代码任务
48GB 显存以上35b+ 与多卡组合默认上下文也会自动加大

跑起来之后用 ollama ps 验证:PROCESSOR 列显示 100% GPU 说明全部进了显存;出现 CPU/GPU 混合比例,说明显存不够被切分,速度会明显下降,此时应换更小的规格而不是硬撑。


Cloud 模型与退役机制

本地算力不够,又想用超大模型时,Ollama 提供了第三条路:cloud 标签的云端模型。

实例

bash

# 登录 Ollama 账号(云模型需要)

ollama signin

# 像本地模型一样运行云模型,无需下载权重

ollama run qwen3.5:cloud

云模型的使用方式与本地模型完全一致:同样的命令、同样的 API、同样的工具集成,只是推理发生在 Ollama 的服务器上。

需要注意云模型有退役机制:官方会定期下线旧模型并给出推荐替代,通过邮件和官网公告通知,依赖某个云模型的自动化流程要留意这类通知。

本地模型完全不受退役机制影响,下载到磁盘上的权重永远可以用,这也是纯本地方案最让团队安心的特性。

AI 思考中...

Ollama 对话与生成参数

Ollama 六大模型能力实战

基于 VitePress 构建,部署于 GitHub Pages