Ollama 融 6500 万治本地不够强,开的药方是让我上云

哈喽,我是飞飞。
昨天我还在算一笔账,算我那条流水线每篇稿子要背多少固定开销。今天不聊钱了,换个问题:活该分给谁干。
起因是一条融资消息。Ollama 拿到钱了。你要是在自己电脑上跑过开源模型,多半用的就是它。
我看到的中文标题写着「完成 8800 万美元融资」。我下意识就去翻自己四月那篇旧文。四月我真把它跑起来过,还在文章结尾给自己划了一条线。
四个月过去,那条线还站得住吗。
那笔钱的两个数
先说个小插曲。说白了,它就是今天这篇要讲的事的预演。
我去核了一下。这轮是 6500 万美元的 B 轮,7 月 9 号宣布,Theory Ventures 领投,Benchmark、8VC、Y Combinator 都在里面。8800 万是它成立到现在的累计融资,两轮加起来的总数。
差别在哪儿呢。我去看了 Ollama 自己那篇博客,通篇只出现一个数字:
Ollama has raised $88M from Peter Fenton at Benchmark…
博客里没写轮次,也没说这个数是累计。一句陈述累计额的话,长成了宣告本轮的样子。把本轮 6500 万、累计 8800 万写清楚的,是同一天发的官方新闻稿。中文源照着博客那句翻,就成了「完成 8800 万融资」。
我不去揣测人家怎么想的。我只想说一句:官方口径这东西,值得自己拆开看一眼。
后面还有几个数,都是同一个性质。890 万开发者、85% 的财富 500 强在用、云端 token 用量平均每月翻一倍。这几个数全是 Ollama 自己报的,没有外部机构核过。你听的时候心里得给它贴个标签。
我四月划了条线
四月那次,我是被账单逼的。
我用 Ollama 拉起 gemma4 的 e4b,把 ANTHROPIC_BASE_URL 指到本机的 11434 端口。Claude Code 就这么接上了本地模型,半小时写出来一个六十行的计算器。全程 API 花费为零。
过程不复述了,那篇写过。我只留三个当时卡住我的东西。
一个是上下文。Ollama 默认给的窗口不满,得手动写 num_ctx 32768,因为 Claude Code 至少要 32K 才转得动。
一个是兜圈子。模型生成到一半停住,停完又把前面写过的内容重新吐一遍。我盯着屏幕等了大概四十秒,才反应过来它在原地打转。
还有一个是速度。gemma4:e4b 在我那台 M1 MacBook Pro 上每秒 20 到 40 个 token。跟云端一比就是慢。
但我那篇的结尾没有说本地不行。我当时的原话是,我改主意了。只要任务不超过它的能力边界,本地比云端更好用。理由就一条:它不会在你最需要的时候突然断网。
所以我划的是一条线。实验、学习、小活,给本地。真要写好代码的复杂活,切云端。
今天要问的,是这条线该不该往上抬。
它抹平的是摩擦
这轮钱主打的方向叫混合推理。
说人话就是,机器扛得住,模型就在你本机跑;扛不住,自动切到它的云上。你这边一行配置都不用改,账号照旧,API 照旧。
它的新闻稿把这事写得很坦白:本地和云端之间,体验没有差别。
我盯着这句话看了一会儿。
作为产品设计,这一手漂亮。可我要问的是另一个问题:本地那一档,变强了吗。
没有。这轮钱买到的东西,不在把本地那一档抬高,在把从本地逃到云上那一下抹平。
打个比方。他们在你家那口井边上,接了一根自来水管。
井还是那口井,水位一寸没涨。只是你从此拧一下就有水。
对我四月那三个卡点来说,这意味着什么。上下文和兜圈子,是小模型自己的毛病。每秒二三十个 token,是我那台 M1 的事。融资不换我的电脑。
三个卡点里,只有能力那一条被正面回应了,而回应的方式是上云。
我留着本地图什么
那我当初为什么非留着本地这条线不可。
我图的不是省钱,是另外三样。数据不出这台机器。断网了照样能跑。模型下下来之后,推理不再计费。
而自来水这东西,天生要接进别人的管网,要人家不停水,还要按吨给钱。
你把这三样摆到那根新管子旁边,问题就出来了。
那条无摩擦的路一旦走上去,这三样同时归零。数据出去了,断网停了,token 重新开始计费。
所以「本地不够强就上云」这句话,对没有这三条诉求的人是纯赚。对我来说不一样。它把我留在本地的那三个理由,跟它给的解决方案,绑到了对立面上。
这话说重了点。我补一句:这是它的产品逻辑,讲得明明白白,没藏。只是我得自己认清一件事。我想要的那部分,和它主推的那部分,不完全重合。
顺带说一个我三月见过的画面。当时 NVIDIA 发了个装在 OpenClaw 上的安全栈,里面有一层叫隐私路由器。它专门做一件事:敏感数据走本地模型,不出设备。
我三月写过它。四月我自己把本地模型跑通了。然后这四个月,我一次都没这么干过。
还有一件事得摆出来,免得把本地说得太干净。
五月的时候,Ollama 有个命令能把 Claude Desktop 切到别家网关。我一直记着这条路。后来 Claude Desktop 升到 1.6259.1,这条路直接堵死。Ollama 的仓库里有人开了 issue,编号 16025。
模型是在我机器上跑的,可那个入口攥在别人手里。所以本地这条线,也没到「全归我管」的程度。说真的,它只把一部分主动权拿了回来,剩下的还得看上游脸色。
有一类活该搬回来
我现在有一个素材库,十三个主题文件。装的全是我自己的一手东西:踩过的坑、真实数字、当时的判断、私人的体感。写每篇稿子之前,流水线都要去里面捞几条。
捞出来的是什么呢。是我踩过的某个坑,是一串我没对外说过的真实数字。它们被拼进一个请求,一路发到云上,走完一整趟往返。
这类活的画像,恰好正中本地那一档的靶心。输入很短,一次就捞几条。任务很机械,匹配、打标、摘一句话。数据很私人,那是我自己的东西。
它一直没搬回本机,原因跟能力无关。是顺手。云端已经接好了,改一次要花半天。
我甚至做过功课。五月底我查过一圈:本地挂个 Qwen 或者 Gemma,配一个 LiteLLM 的代理,十来分钟就能把我那套 skill 文件在本机跑起来。GitHub 上早有现成的项目在干这事。
我查完,写进文章里,然后就没有然后了。
功课做到位、方案摆在那儿、就是不动手,这个状态我猜你也熟。实话讲,挡住我的从来不在技术难度,在那半天。
所以这篇的可执行动作,我给自己也给你。换一把尺子重新分一遍活,只问三件事。
这活的输入该不该出本机。它要吃多长的上下文。断网了还要不要它继续跑。
三条里中两条,现在就该在本地跑。一条都不中,老老实实用云端,别为了本地而本地。
我那个素材库检索,三条中了两条,输入短、数据私。它该搬。
可你也看见了,五月我就把该怎么搬查清楚了,到今天也没搬。
所以这句「它该搬」,你先别当结论听。当成我立在这儿的一张欠条。
什么时候我才挪线
重活那条线,我今天不动。
但我不想拿「再看看」这种话糊弄过去,所以我把条件写死。
我拿四月那个计算器当基准题。同一台 M1,不换机器,同一个 gemma4:e4b。什么时候它能一次吃满 32K 上下文不再原地打转,一口气把那六十行写完,中间不用我拆成好几段喂给它。做到了,我就把线往上抬一格。
这个复测三个月做一次。做不到就还是老样子。
也得说清我不知道的部分。Ollama 的云端服务我没跑过,新版本我没测过。上面那三个数字,是四月那台机器上的实测。这三个月里 Ollama 和 gemma4 都可能变过。我拿它当自己的起点,没拿它当今天的结论。
一件工具融了多少钱,跟它今天配干你哪些活,中间隔着的距离比你以为的远。融资改的是它三年后的样子。你今天要分的活,还得自己拿尺子量。
想问问你。你手边那些天天要跑的活里,有没有哪一件的输入其实不该出本机?就因为云端已经接好了太顺手,你一直往外发。评论区聊聊,我想知道大家都在往外发什么。