本地AI离线也好用!Gemma 4让你的电脑变身本地AI助手,不用token完全免费 ,手机也能离线使用
摘要
Google 推出的 Gemma 4 本地模型可免费下载到电脑与手机,完全离线运行、避免资料泄露。文章介绍用 LM Studio(电脑,选 E4B 版)与 Google AI Edge Gallery App(手机,选 E2B 版)部署对话,支持图文、文档处理;进阶部分演示接入 Brave Search API 联网、授权本地文件夹操作、关联 VS Code 的 Continue 插件做程序开发。适合无网环境或注重隐私的场景。
前言
Google 新推出的开源 AI 模型 Gemma 4,一个很吸引人的点是可以免费下载到手机和电脑本地使用,而且能完全离线运行,这就意味着你的对话、文件数据都不会经过任何服务器,隐私性拉满。虽然它的"聪明程度"比不上顶级的联网模型(比如 Gemini 旗舰版或 GPT 系列),但在无网络环境下表现也不错,已经能完成不少复杂的任务。
Gemma 4 主要有 4 个版本:E2B、E4B、26B、31B。其中 E2B、E4B 面向手机和笔记本,26B、31B 面向 Mac 和台式机等性能更强的设备。想知道自己的电脑适合跑哪个版本,可以访问:https://www.canirun.ai 一键检测。

为什么"本地"和"在线"是两个不同的东西
很多人第一次接触本地模型时会有个误解:觉得它只是"弱化版的在线模型"。其实两者的取舍完全不同,先理解这一点,后面的参数选择就顺理成章了。
在线模型(API) | 本地模型 | |
|---|---|---|
数据去哪 | 发到服务商服务器 | 不出本机 |
要不要网 | 必须联网 | 完全离线可用 |
能力上限 | 顶级(几百 B~上 T 参数) | 受限(你设备能扛多大就跑多大) |
知识时效 | 持续更新 | 冻结在训练截止时间 |
能联网查资料 | 通常可以 | 默认不能(要额外接搜索) |
花钱 | 按 token 计费 | 一次下载,永久免费 |
稳定性 | 受限于平台限流/宕机 | 只看你机器开不开机 |
结论:本地模型不是"便宜版的在线模型",而是**"把隐私和独立性换成了能力上限"**。你的数据敏感、或者处在没网的环境,本地模型就是不可替代的;你要最强的推理能力,那还是得用在线 API。
想白嫖在线额度的话,我之前整理过一份免费大模型 API 资源汇总;两者其实可以配合用——日常用在线,敏感内容切本地。
怎么选版本:参数量和你的内存
E2B / E4B / 26B / 31B 里的 "B" 是 Billion(十亿参数)。数字越大越聪明,但也越吃内存。这里有个大致的换算关系(估算值,实际以具体量化版本为准):
4-bit 量化下,每 10 亿参数大约需要 0.6~0.8 GB 内存
所以 26B 大约要 16~20 GB,31B 更高
而 E2B / E4B 这类小模型,几 GB 内存就能跑,这就是它们能上手机的原因
但内存不是唯一变量,还要给"上下文"留地方。模型运行时会把对话内容缓存在内存里(叫 KV Cache),上下文越长,这部分占用越大,而且是线性增长的。这就是为什么第 3 步里"把上下文调大"这个操作不是免费的——你调的每个数字都在吃内存。内存刚好够跑模型的时候,上下文一开大就容易崩。
所以选版本的实用建议:先看你设备有多少内存,再留出足够的余量给上下文,最后才决定跑哪个尺寸。 用 canirun.ai 检测是个不错的起点。
电脑上怎么用
目前电脑上运行本地大模型的主流方法有两种:
Ollama:偏命令行操作,适合专业人员、喜欢脚本化的人。
LM Studio(本文用的这种):偏图形界面操作,下载、选模型、对话都在窗口里点点点搞定,更适合普通人。
这两个不是"谁更好",而是用途不同:
LM Studio 的价值在于"探索"——你可以直观地试不同模型、看内存占用、调参数,适合搞清楚自己设备能跑什么
Ollama 的价值在于"被别的程序调用"——它是命令行+本地 API 的形式,方便脚本、自动化流程在后台用它。很多开源工具(比如本地知识库项目)都默认支持"连接 Ollama"
我的建议是:先用 LM Studio 试明白,等要接自动化了再装 Ollama,两者可以共存。
下载 LM Studio:Windows、macOS、Linux 都有,访问官网下载:https://lmstudio.ai

2. 安装 Gemma 4 模型:我是笔记本,所以选 E4B 这个版本。模型卡片上通常有几个小图标,分别代表视觉能力、skill(技能)能力、推理能力,可以据此判断这个模型能做什么。

3. 下载完成后可以调模型设置,比如修改上下文长度(context length)——如果你要让它分析较大的文件,把上下文调大一些效果更好。

4. 修改系统提示词:这里可以输入给 AI 设定"规则",比如"你是一名严谨的技术编辑""请用中文回答"等,让它更贴合你的使用习惯。

5. 日常使用:基本和豆包、DeepSeek 一样,通过对话的形式提问即可。它也能处理图片和文档内容(视觉模型),直接把文件拖进对话框就能分析。



手机上怎么用
手机端更简单:
手机安装 Google AI Edge Gallery 这个 App,安卓、iOS 的应用商店都能搜到。

2. 打开对话界面,先下载 AI 模型。手机上我选了 Gemma 4 E2B(手机端的小模型,兼顾体积与可用性)。

3. 下载完成后就能直接对话了。

4. 手机端同样支持视觉功能,拍照提问、识图翻译都可以离线完成。

手机本地模型最被低估的场景,其实是"出国/飞行":手机上常见的翻译方案都要联网,一旦没信号就废了。而本地模型的翻译能力和网络状态完全无关——飞机上、境外无卡、或者山区没信号,它照样能用。加上视觉能力,对着菜单、路牌拍照就能翻。这是我认为手机端最实用的用途。
进阶玩法:给 LM Studio 接上更多能力
LM Studio 不止能本地聊天,还可以通过连接其他 MCP / 工具完成更高难度的任务:
连接 Brave Search API 增加联网搜索:在 LM Studio 里配置 Brave 的搜索 API,就能让本地模型也能"联网查资料"。地址:https://brave.com/search/api

2. 给系统提示增加文件夹访问权限:让模型能读取本地文件夹,实现简单的本地文件操作。

3. 关联 VSCode 做简单开发:让本地模型帮你写代码。三步搞定:
在 LM Studio 里开启本地服务器(开启后它会提供一个本地 API 地址)。

VSCode 端安装 Continue 插件。

在 Continue 里连接 LM Studio,选好模型后输入提示词,就能让它在编辑器里生成你要的程序。测试时如果结果不理想,可以直接通过对话让它修改。


第 1 条(联网搜索)值得解释一下,因为它补的正是本地模型最大的短板。本地模型的知识冻结在训练结束时,问它"今天发生了什么"它一无所知。接上搜索 API 之后,它就能"先搜、再读、再回答",相当于给它开了一扇通向外界的窗。
但要注意一个前提:开了联网搜索,你的提问内容会被发给搜索引擎。也就是说,原本"完全不出本机"的隐私优势,在这一步会部分让渡出去。敏感内容建议临时把搜索关掉。
第 2 条(文件夹访问权限)同理,而且风险更直接:给模型读取本地文件夹的权限,意味着它能读到里面的东西,也会把这些内容作为上下文送给模型。虽然模型跑在本地,但如果它同时接了联网搜索或其他外部工具,内容就有流出的可能。授权时只给单个目录,别给整个磁盘。
三个常见误区
1. "本地模型不需要联网,所以绝对安全"
不完全对。本地模型的推理过程确实在本机,但只要你给它接了任何外部工具(搜索、MCP、云端 API),内容就有可能流出去。"本地"保护的是"模型推理"这一环,不是全部环节。
2. "参数量越大越好"
在本地场景里,能跑起来、跑得动才是第一位的。一个 31B 模型如果让你的机器风扇狂转、每条回复等半分钟,实际体验远不如一个流畅的 E4B。而且本地模型之间,尺寸带来的差距远没有"本地 vs 在线"那么大。
3. "下载了就一直能用"
模型文件本身是永久的,但运行它的软件(LM Studio、Ollama)会更新,新版本偶尔会有兼容性变化。如果想长期稳定,建议保留一份当前能用的安装包,别急着升级。
小结
坦白讲,本地大模型的实际可用程度和电脑配置直接相关,而且大多数场景下远不如在线的 API 好用——毕竟在线模型更大、更强、迭代更快。但本地模型的优势在于隐私性好、完全离线,所以拿来处理一些敏感文件、做本地翻译整理,是完全够用的。手机端在飞机上、国外等无网络环境下,语音翻译、识图翻译这些功能尤其好用。
如果你是隐私敏感型用户,或者经常出入无网环境,这套本地 AI 方案值得一试。 而如果你更在意"能力上限",那还是搭配在线 API 用更实际——两条路本来就不冲突。