Skip to content

Ollama 运行模型

Ollama 运行模型使用 ollama run 命令。

例如我们要运行 qwen3.5:0.8b 并与该模型对话可以使用以下命令:

首次运行自动下载,约 1.0GB:

bash
ollama run qwen3.5:0.8b

命令执行后会先看到下载进度,下载完成后直接进入对话:

bash
$ ollama run qwen3.5:0.8b
pulling manifest
pulling 87497c5f0e8f... 100% |████████████████████| 1.0GB
pulling 5e2ad5... 100% |████████████████████|  11KB
verifying sha256 digest
writing manifest
success
>>> 你好,你是什么模型?

>>> /bye

看到 \>>> 提示符就说明模型已经加载完成,输入问题回车即可对话。

下载中途断网不必重来,Ollama 支持断点续传,重新执行同样的命令会从上次进度继续。

runoob1787974685637.png


用交互菜单选择模型

除了直接敲命令,直接输入 ollama 不带参数会打开交互式菜单,新版把它作为统一入口。

bash
$ ollama
Chat, Code, & Work
    Chat with models, code, search the web, and delegate real work

  Launch Claude Code
    Anthropic's coding tool with subagents

  Launch OpenCode
    Anomaly's open-source coding agent

  Launch Hermes Agent
    Self-improving AI agent built by Nous Research

  Launch OpenClaw
    Personal AI with 100+ skills

  More...
    Show additional integrations

选择 Chat, Code, & Work 即可挑选一个已下载的模型开始聊天,效果和 ollama run 完全一致。

runoob1787974812647.png

这里可以选择模型:

runoob1787974838663.png

菜单里的 Launch 用于启动 VS Code、Claude Code 等集成工具,属于进阶玩法,教程后面会专门介绍。


挑选第一个模型:看内存下菜

模型不是越大越好,跑不动的模型只会让你的电脑风扇狂转、回复以秒甚至分钟计。

新手选择的原则很简单:先跑小的,流畅之后再逐步加大。对照自己机器的内存和显存选:

你的机器配置推荐标签下载体积体验预期
8GB 内存,无独立显卡qwen3.5:0.8b / 2b1.0 ~ 2.7GB轻量对话流畅
16GB 内存,无独立显卡qwen3.5:4b / 9b3.4 ~ 6.6GB默认规格,质量与速度均衡
8GB 以上显存的显卡qwen3.5:9b 或 qwen3.5:latest约 6.6GBGPU 加速,速度明显提升
16GB 以上显存的显卡qwen3.5:27b约 17GB更高质量的长文与代码
配置实在不足qwen3.5:cloud无需下载云端推理,需登录 Ollama 账号

同一模型的不同规格,能力差距是真实存在的。0.8b 适合验证环境,日常使用建议至少 4b 起步。


理解 model:tag 命名规则

你在命令里写的名字由"模型名 + 标签"两部分组成,这决定了你下载的到底是什么。

model-tag.svg

模型名:家族的名字

模型名对应官方模型库里的一家人,比如 qwen3.5、gemma4、deepseek-r1。

同一家族下会有多个规格,它们共用一个模型名。

标签:规格与版本

标签决定具体下载哪个文件,常见的是参数规格,如 0.8b、9b、27b。

不写标签时,Ollama 自动补上 latest,也就是官方为该模型设置的默认规格。

对 qwen3.5 来说,ollama run qwen3.5 等价于 ollama run qwen3.5:latest,当前指向 9b 规格。

命名空间:谁发布的

带斜杠的名字表示第三方发布的模型,斜杠前是发布者的用户名。

官方模型库里的模型没有命名空间,个人或团队发布的模型(例如 runoob/my-model:4b 这种格式)才会带,模型的分享与分发在私有化部署章节演示。

查看已下载的模型

不确定本地有哪些模型、各占多少空间时,用 list 命令查看:

实例

bash

# 列出本地所有模型

ollama list
bash
$ ollama list
NAME               ID            SIZE      MODIFIED
qwen3.5:0.8b       9e3f4b3a1c2d  1.0GB     5 minutes ago
qwen3.5:latest     a8b2c9d3e4f5  6.6GB     2 hours ago

下一章会把 list、show、rm 等模型管理命令讲全。


退出、重进与切换模型

对话状态下输入 /bye 即可退出,回到普通终端。

实例

bash

# 输入 /bye 退出对话,回到普通终端

/bye

再次运行同一条 ollama run 命令就能重新进入对话,模型已经下载过,这次几乎是秒进。

想换一个模型聊天,直接 run 另一个模型即可,两个模型可以来回切换:

实例

bash

# 从小模型切换到默认规格

ollama run qwen3.5:4b

# 再切回来也一样

ollama run qwen3.5:0.8b

切换后,之前那个模型会在内存里保留约 5 分钟,没有新请求就自动卸载,这个机制叫 keep-alive,下一章会讲怎么调整它。

对话中要输入多行文字时,用三个双引号包裹:

实例

bash

>>> """把下面这段话翻译成英文:

... RUNOOB 是一个教程网站。

... 谢谢。

... """

通过 Python SDK 使用模型

如果你希望将 Ollama 与 Python 代码集成,可以使用 Ollama 的 Python SDK 来加载和运行模型。

1. 安装 Python SDK

首先,需要安装 Ollama 的 Python SDK,打开终端,执行以下命令:

bash
pip install ollama

2. 编写 Python 脚本

接下来,你可以使用 Python 代码来加载和与模型交互。

以下是一个简单的 Python 脚本示例,演示如何使用 qwen3.5 模型来生成文本:

实例

python
import ollama

response = ollama.generate(

    model="qwen3.5",  # 模型名称

    prompt="你是谁。"  # 提示文本

)

print(response)

3. 运行 Python 脚本

在终端中运行你的 Python 脚本:

bash
python test.py

你会看到模型根据你的输入返回的回答。

4.对话模式

实例

python
from ollama import chat

response = chat(

    model="qwen3.5",

    messages=[

        {"role": "user", "content": "为什么天空是蓝色的?"}

    ]

)

print(response.message.content)

此代码会与模型进行对话,并打印模型的回复。

5. 流式响应

实例

python
from ollama import chat

stream = chat(

    model="qwen3.5",

    messages=[{"role": "user", "content": "为什么天空是蓝色的?"}],

    stream=True

)

for chunk in stream:

    print(chunk["message"]["content"], end="", flush=True)

此代码会以流式方式接收模型的响应,适用于处理大数据。

AI 思考中...

Ollama 安装

Ollama 相关命令

基于 VitePress 构建,部署于 GitHub Pages