用本地模型完全离线运行 More AI(Ollama 与 LM Studio)

把 More AI 指向一个在你自己硬件上运行的模型,任何东西都不会离开你的电脑——没有 API 账单,也不需要联网。本文介绍如何在几分钟内配置好 Ollama 或 LM Studio,以及本地模型在各个模式下的实际表现。

More AI 团队 · 更新于 2026年7月16日

为什么在本地运行模型

每一个云端模型——哪怕是通过你自己的 API 密钥——都意味着你的提示词要发送到别人的服务器上。本地模型去掉了这最后一跳:模型在你自己的硬件上运行,More AI 通过 localhost 与它通信,你的对话完全不经过网络。这正是处理敏感文档、物理隔离环境,或干脆在飞机上工作时想要的配置。

第二个理由是成本:本地模型没有按 token 的价格。问它一千个问题,账单也只是你的电费。坦率的代价在于能力——本地模型比前沿云端模型小,所以把高难度的推理任务留给云端密钥,让本地模型承担日常工作。

Ollama:最快的路线

安装 Ollama,用一条命令拉取一个模型(例如一个与你内存大小相称的 Llama、Qwen 或 Gemma 版本),它便会在本地提供该模型。在 More AI 中打开「设置 → 提供商」并启用 Ollama——不需要 API 密钥,也不需要任何配置。应用会自动识别你已安装的模型,它们会与你的云端模型并列出现在模型选择器里。

接下来它的表现与任何其他提供商无异:为一段对话选中本地模型,开始输入即可。上下文窗口用量表和按对话切换模型也都照常工作。

LM Studio:友好的模型管理器

更偏好图形界面?LM Studio 让你浏览并下载开放模型,然后一键从本地服务器提供服务。More AI 像支持 Ollama 一样把它当作一等提供商来支持:在「设置 → 提供商」里启用它,你下载好的模型便会出现在选择器中。

其他任何服务器:自定义端点

在运行 vLLM、llama.cpp 或 LiteLLM 代理?添加一个自定义提供商,把它指向任何讲 OpenAI 兼容 Chat Completions API 的端点(基础 URL 通常以 /v1 结尾)——或指向一个兼容 Anthropic 的 Messages 端点。这几乎覆盖了所有自托管的模型服务器,无论它在你的电脑上,还是在局域网里的另一台机器上。

模型选择器中本地模型与云端提供商并列显示

本地与云端混着用

你不必一次定终身。密钥和本地提供商并肩共存,每段对话都可以选择自己的模型——一个实用的配置是:私人笔记和快速提问用本地模型,值得动用大模型的任务再切到前沿模型。切换只是两次点击,而不是一次重新配置。

三种模式都能配合本地模型使用——Chat、Cowork 和 Code 都跑在同一套引擎上。在智能体模式下,尽量选用你硬件能承载的最强本地模型:做规划和调用工具都更青睐能力更强的模型。

常见问题

运行本地模型真的免费吗?

没有按 token 的费用——模型在你自己的硬件上运行,唯一的成本是电脑消耗的电费。More AI 应用本身也是免费的。

所有功能都能离线使用吗?

配合本地模型,Chat、Cowork 和 Code 都能完全离线工作——文件、文档和代码仓库本来就在你的磁盘上。只有那些本质上需要联网的功能(网页搜索、同步、连接器)会等到你重新上线。

我需要什么样的硬件?

小模型在 8–16 GB 内存里就能流畅运行;更大、更强的模型需要更多内存或一块 GPU。Apple 芯片的 Mac 尤其适合。先从小模型开始,看看你的机器能跑到什么程度,再逐步升级。

More AI 支持哪些本地服务器?

Ollama 和 LM Studio 是内置支持的——无需密钥,启用即可,别无其他设置。除此之外,任何兼容 OpenAI 的端点(vLLM、llama.cpp、LiteLLM)或兼容 Anthropic 的端点都可以作为自定义提供商使用。

编码智能体能用本地模型吗?

能——Code 模式跑在同一套引擎上,因此本地模型同样可以做规划和编辑。智能体工作更青睐强模型,所以请选用你硬件能承载的最强本地模型,或者把那一次会话切到云端密钥。

全部指南