Ollama 融 6500 万治本地不够强,开的药方是让我上云

cover

哈喽,我是飞飞。

昨天我还在算一笔账,算我那条流水线每篇稿子要背多少固定开销。今天不聊钱了,换个问题:活该分给谁干。

起因是一条融资消息。Ollama 拿到钱了。你要是在自己电脑上跑过开源模型,多半用的就是它。

我看到的中文标题写着「完成 8800 万美元融资」。我下意识就去翻自己四月那篇旧文。四月我真把它跑起来过,还在文章结尾给自己划了一条线。

四个月过去,那条线还站得住吗。

那笔钱的两个数

先说个小插曲。说白了,它就是今天这篇要讲的事的预演。

我去核了一下。这轮是 6500 万美元的 B 轮,7 月 9 号宣布,Theory Ventures 领投,Benchmark、8VC、Y Combinator 都在里面。8800 万是它成立到现在的累计融资,两轮加起来的总数。

差别在哪儿呢。我去看了 Ollama 自己那篇博客,通篇只出现一个数字:

Ollama has raised $88M from Peter Fenton at Benchmark…

博客里没写轮次,也没说这个数是累计。一句陈述累计额的话,长成了宣告本轮的样子。把本轮 6500 万、累计 8800 万写清楚的,是同一天发的官方新闻稿。中文源照着博客那句翻,就成了「完成 8800 万融资」。

我不去揣测人家怎么想的。我只想说一句:官方口径这东西,值得自己拆开看一眼。

后面还有几个数,都是同一个性质。890 万开发者、85% 的财富 500 强在用、云端 token 用量平均每月翻一倍。这几个数全是 Ollama 自己报的,没有外部机构核过。你听的时候心里得给它贴个标签。

我四月划了条线

四月那次,我是被账单逼的。

我用 Ollama 拉起 gemma4 的 e4b,把 ANTHROPIC_BASE_URL 指到本机的 11434 端口。Claude Code 就这么接上了本地模型,半小时写出来一个六十行的计算器。全程 API 花费为零。

过程不复述了,那篇写过。我只留三个当时卡住我的东西。

一个是上下文。Ollama 默认给的窗口不满,得手动写 num_ctx 32768,因为 Claude Code 至少要 32K 才转得动。

一个是兜圈子。模型生成到一半停住,停完又把前面写过的内容重新吐一遍。我盯着屏幕等了大概四十秒,才反应过来它在原地打转。

还有一个是速度。gemma4:e4b 在我那台 M1 MacBook Pro 上每秒 20 到 40 个 token。跟云端一比就是慢。

但我那篇的结尾没有说本地不行。我当时的原话是,我改主意了。只要任务不超过它的能力边界,本地比云端更好用。理由就一条:它不会在你最需要的时候突然断网。

所以我划的是一条线。实验、学习、小活,给本地。真要写好代码的复杂活,切云端。

今天要问的,是这条线该不该往上抬。

它抹平的是摩擦

这轮钱主打的方向叫混合推理。

说人话就是,机器扛得住,模型就在你本机跑;扛不住,自动切到它的云上。你这边一行配置都不用改,账号照旧,API 照旧。

它的新闻稿把这事写得很坦白:本地和云端之间,体验没有差别。

我盯着这句话看了一会儿。

作为产品设计,这一手漂亮。可我要问的是另一个问题:本地那一档,变强了吗。

没有。这轮钱买到的东西,不在把本地那一档抬高,在把从本地逃到云上那一下抹平。

打个比方。他们在你家那口井边上,接了一根自来水管。

井还是那口井,水位一寸没涨。只是你从此拧一下就有水。

对我四月那三个卡点来说,这意味着什么。上下文和兜圈子,是小模型自己的毛病。每秒二三十个 token,是我那台 M1 的事。融资不换我的电脑。

三个卡点里,只有能力那一条被正面回应了,而回应的方式是上云。

我留着本地图什么

那我当初为什么非留着本地这条线不可。

我图的不是省钱,是另外三样。数据不出这台机器。断网了照样能跑。模型下下来之后,推理不再计费。

而自来水这东西,天生要接进别人的管网,要人家不停水,还要按吨给钱。

你把这三样摆到那根新管子旁边,问题就出来了。

那条无摩擦的路一旦走上去,这三样同时归零。数据出去了,断网停了,token 重新开始计费。

所以「本地不够强就上云」这句话,对没有这三条诉求的人是纯赚。对我来说不一样。它把我留在本地的那三个理由,跟它给的解决方案,绑到了对立面上。

这话说重了点。我补一句:这是它的产品逻辑,讲得明明白白,没藏。只是我得自己认清一件事。我想要的那部分,和它主推的那部分,不完全重合。

顺带说一个我三月见过的画面。当时 NVIDIA 发了个装在 OpenClaw 上的安全栈,里面有一层叫隐私路由器。它专门做一件事:敏感数据走本地模型,不出设备。

我三月写过它。四月我自己把本地模型跑通了。然后这四个月,我一次都没这么干过。

还有一件事得摆出来,免得把本地说得太干净。

五月的时候,Ollama 有个命令能把 Claude Desktop 切到别家网关。我一直记着这条路。后来 Claude Desktop 升到 1.6259.1,这条路直接堵死。Ollama 的仓库里有人开了 issue,编号 16025。

模型是在我机器上跑的,可那个入口攥在别人手里。所以本地这条线,也没到「全归我管」的程度。说真的,它只把一部分主动权拿了回来,剩下的还得看上游脸色。

有一类活该搬回来

我现在有一个素材库,十三个主题文件。装的全是我自己的一手东西:踩过的坑、真实数字、当时的判断、私人的体感。写每篇稿子之前,流水线都要去里面捞几条。

捞出来的是什么呢。是我踩过的某个坑,是一串我没对外说过的真实数字。它们被拼进一个请求,一路发到云上,走完一整趟往返。

这类活的画像,恰好正中本地那一档的靶心。输入很短,一次就捞几条。任务很机械,匹配、打标、摘一句话。数据很私人,那是我自己的东西。

它一直没搬回本机,原因跟能力无关。是顺手。云端已经接好了,改一次要花半天。

我甚至做过功课。五月底我查过一圈:本地挂个 Qwen 或者 Gemma,配一个 LiteLLM 的代理,十来分钟就能把我那套 skill 文件在本机跑起来。GitHub 上早有现成的项目在干这事。

我查完,写进文章里,然后就没有然后了。

功课做到位、方案摆在那儿、就是不动手,这个状态我猜你也熟。实话讲,挡住我的从来不在技术难度,在那半天。

所以这篇的可执行动作,我给自己也给你。换一把尺子重新分一遍活,只问三件事。

这活的输入该不该出本机。它要吃多长的上下文。断网了还要不要它继续跑。

三条里中两条,现在就该在本地跑。一条都不中,老老实实用云端,别为了本地而本地。

我那个素材库检索,三条中了两条,输入短、数据私。它该搬。

可你也看见了,五月我就把该怎么搬查清楚了,到今天也没搬。

所以这句「它该搬」,你先别当结论听。当成我立在这儿的一张欠条。

什么时候我才挪线

重活那条线,我今天不动。

但我不想拿「再看看」这种话糊弄过去,所以我把条件写死。

我拿四月那个计算器当基准题。同一台 M1,不换机器,同一个 gemma4:e4b。什么时候它能一次吃满 32K 上下文不再原地打转,一口气把那六十行写完,中间不用我拆成好几段喂给它。做到了,我就把线往上抬一格。

这个复测三个月做一次。做不到就还是老样子。

也得说清我不知道的部分。Ollama 的云端服务我没跑过,新版本我没测过。上面那三个数字,是四月那台机器上的实测。这三个月里 Ollama 和 gemma4 都可能变过。我拿它当自己的起点,没拿它当今天的结论。

一件工具融了多少钱,跟它今天配干你哪些活,中间隔着的距离比你以为的远。融资改的是它三年后的样子。你今天要分的活,还得自己拿尺子量。

想问问你。你手边那些天天要跑的活里,有没有哪一件的输入其实不该出本机?就因为云端已经接好了太顺手,你一直往外发。评论区聊聊,我想知道大家都在往外发什么。