Ollama 运行模型
Ollama 运行模型使用 ollama run 命令。
例如我们要运行 qwen3.5:0.8b 并与该模型对话可以使用以下命令:
首次运行自动下载,约 1.0GB:
ollama run qwen3.5:0.8b命令执行后会先看到下载进度,下载完成后直接进入对话:
$ ollama run qwen3.5:0.8b
pulling manifest
pulling 87497c5f0e8f... 100% |████████████████████| 1.0GB
pulling 5e2ad5... 100% |████████████████████| 11KB
verifying sha256 digest
writing manifest
success
>>> 你好,你是什么模型?
>>> /bye看到 \>>> 提示符就说明模型已经加载完成,输入问题回车即可对话。
下载中途断网不必重来,Ollama 支持断点续传,重新执行同样的命令会从上次进度继续。

用交互菜单选择模型
除了直接敲命令,直接输入 ollama 不带参数会打开交互式菜单,新版把它作为统一入口。
$ ollama
Chat, Code, & Work
Chat with models, code, search the web, and delegate real work
Launch Claude Code
Anthropic's coding tool with subagents
Launch OpenCode
Anomaly's open-source coding agent
Launch Hermes Agent
Self-improving AI agent built by Nous Research
Launch OpenClaw
Personal AI with 100+ skills
More...
Show additional integrations选择 Chat, Code, & Work 即可挑选一个已下载的模型开始聊天,效果和 ollama run 完全一致。

这里可以选择模型:

菜单里的 Launch 用于启动 VS Code、Claude Code 等集成工具,属于进阶玩法,教程后面会专门介绍。
挑选第一个模型:看内存下菜
模型不是越大越好,跑不动的模型只会让你的电脑风扇狂转、回复以秒甚至分钟计。
新手选择的原则很简单:先跑小的,流畅之后再逐步加大。对照自己机器的内存和显存选:
| 你的机器配置 | 推荐标签 | 下载体积 | 体验预期 |
|---|---|---|---|
| 8GB 内存,无独立显卡 | qwen3.5:0.8b / 2b | 1.0 ~ 2.7GB | 轻量对话流畅 |
| 16GB 内存,无独立显卡 | qwen3.5:4b / 9b | 3.4 ~ 6.6GB | 默认规格,质量与速度均衡 |
| 8GB 以上显存的显卡 | qwen3.5:9b 或 qwen3.5:latest | 约 6.6GB | GPU 加速,速度明显提升 |
| 16GB 以上显存的显卡 | qwen3.5:27b | 约 17GB | 更高质量的长文与代码 |
| 配置实在不足 | qwen3.5:cloud | 无需下载 | 云端推理,需登录 Ollama 账号 |
同一模型的不同规格,能力差距是真实存在的。0.8b 适合验证环境,日常使用建议至少 4b 起步。
理解 model:tag 命名规则
你在命令里写的名字由"模型名 + 标签"两部分组成,这决定了你下载的到底是什么。
模型名:家族的名字
模型名对应官方模型库里的一家人,比如 qwen3.5、gemma4、deepseek-r1。
同一家族下会有多个规格,它们共用一个模型名。
标签:规格与版本
标签决定具体下载哪个文件,常见的是参数规格,如 0.8b、9b、27b。
不写标签时,Ollama 自动补上 latest,也就是官方为该模型设置的默认规格。
对 qwen3.5 来说,ollama run qwen3.5 等价于 ollama run qwen3.5:latest,当前指向 9b 规格。
命名空间:谁发布的
带斜杠的名字表示第三方发布的模型,斜杠前是发布者的用户名。
官方模型库里的模型没有命名空间,个人或团队发布的模型(例如 runoob/my-model:4b 这种格式)才会带,模型的分享与分发在私有化部署章节演示。
查看已下载的模型
不确定本地有哪些模型、各占多少空间时,用 list 命令查看:
实例
# 列出本地所有模型
ollama list$ ollama list
NAME ID SIZE MODIFIED
qwen3.5:0.8b 9e3f4b3a1c2d 1.0GB 5 minutes ago
qwen3.5:latest a8b2c9d3e4f5 6.6GB 2 hours ago下一章会把 list、show、rm 等模型管理命令讲全。
退出、重进与切换模型
对话状态下输入 /bye 即可退出,回到普通终端。
实例
# 输入 /bye 退出对话,回到普通终端
/bye再次运行同一条 ollama run 命令就能重新进入对话,模型已经下载过,这次几乎是秒进。
想换一个模型聊天,直接 run 另一个模型即可,两个模型可以来回切换:
实例
# 从小模型切换到默认规格
ollama run qwen3.5:4b
# 再切回来也一样
ollama run qwen3.5:0.8b切换后,之前那个模型会在内存里保留约 5 分钟,没有新请求就自动卸载,这个机制叫 keep-alive,下一章会讲怎么调整它。
对话中要输入多行文字时,用三个双引号包裹:
实例
>>> """把下面这段话翻译成英文:
... RUNOOB 是一个教程网站。
... 谢谢。
... """通过 Python SDK 使用模型
如果你希望将 Ollama 与 Python 代码集成,可以使用 Ollama 的 Python SDK 来加载和运行模型。
1. 安装 Python SDK
首先,需要安装 Ollama 的 Python SDK,打开终端,执行以下命令:
pip install ollama2. 编写 Python 脚本
接下来,你可以使用 Python 代码来加载和与模型交互。
以下是一个简单的 Python 脚本示例,演示如何使用 qwen3.5 模型来生成文本:
实例
import ollama
response = ollama.generate(
model="qwen3.5", # 模型名称
prompt="你是谁。" # 提示文本
)
print(response)3. 运行 Python 脚本
在终端中运行你的 Python 脚本:
python test.py你会看到模型根据你的输入返回的回答。
4.对话模式
实例
from ollama import chat
response = chat(
model="qwen3.5",
messages=[
{"role": "user", "content": "为什么天空是蓝色的?"}
]
)
print(response.message.content)此代码会与模型进行对话,并打印模型的回复。
5. 流式响应
实例
from ollama import chat
stream = chat(
model="qwen3.5",
messages=[{"role": "user", "content": "为什么天空是蓝色的?"}],
stream=True
)
for chunk in stream:
print(chunk["message"]["content"], end="", flush=True)此代码会以流式方式接收模型的响应,适用于处理大数据。
AI 思考中...