飞飞的AI实验室

用AI放大灵感,把想法变成作品。

OpenAI CFO Sarah Friar 在 2026 年 7 月 17 日提出「每美元有用智能」记分卡,用四问衡量 AI 投入产出,成本里明确算上了人工复核、重试和返工。我拿这四问量自己那条出了 127 篇稿子的内容流水线,前三问都答得上,卡在最后一问:我的可靠性靠 146 条规则堆出来,而规则库已涨到 50 万字节、843 行,大到工具读不动整份,每篇稿子却都要重付一遍。企业规模化能把固定成本摊薄,个人流水线摊不薄,可靠性和规模经济在这儿是打架的。

阅读全文 »

Simon Willison 用 Fable 5 做了个 LLM 套话高亮器,只标记十种套话、不拦人。我那套写作检测系统当初敢拦:低于 80 分自动打回、最多循环 3 轮、不达标阻断流水线,结果一次批量跑 10 篇,烧掉 64 次调用、270 万 token,8 篇卡在轮次上限,零交付。结论是硬规则可以有阻断权,主观评分只配有建议权。

阅读全文 »

Claude Fable 5 是 Anthropic 最强通用模型,Cursor 的 CursorBench 以 Max effort 拿下 72.9% 新高,一句提示能自主登月,而 Opus 跑十几个小时没成。但它默认不开、要手动选,默认仍是 Sonnet 5。我按自己的模型分工阶梯判断,它该顶的不在九成日常活,在没人盯、要跑很久的长异步任务。

阅读全文 »

Kimi K3 在 Arena.ai 前端编码榜以 1679 分登顶,压过 Claude Fable 5 和 GPT-5.6 Sol。Moonshot 自己承认用户体验有明显差距。K3 定价对标 Sonnet 5,是 K2.6 的 3 到 4 倍。作为 Claude Code Max 用户,我判断这只是能力信号,7/27 开权重前不搬家。

阅读全文 »

VentureBeat 调查 107 家企业,54% 已出过 AI agent 安全事件(18% 确认、36% 险情),去重后 69% 存在凭证共享,只 30% 给高危 agent 上沙箱。我拿这把尺子量自己十几个串起来跑的 skill,它们全从同一个 .env.local 取钥匙,我就是那多数派。个人开发者最该先补的不在拦外面,在给能发布、能动生产的高危 agent 单独拆一把钥匙、卡一道人工确认闸。

阅读全文 »

上周 Grok 被抓包实锤偷传整库那篇我写过了,这周 xAI 反手把对标 Claude Code 的 Grok Build 整个开源,Apache 2.0、约 84 万行 Rust,skill、hook、MCP、子 agent 那套扩展模型跟 Claude Code 一个模子。但安全研究者确认那段偷传代码还在开源新版二进制里,只被服务端开关摁住。我的判断是开源没把信任赚回来,只是递来一条本地编译加本地推理的活路,真要试就拿空沙盒跑边角料,绝不用默认云端模式碰真仓库。

阅读全文 »

Claude 的 artifact 现在能调 MCP 连接器,静态卡片变成会按需取数的活应用,但只认你在 claude.ai 上授权的连接器,Claude Code 里本地配的 MCP 接不进去;一旦声明要调 MCP,这个页面就不能再公开分享。适用 Pro、Max、Team、企业版,读写都支持,每个查看者用自己的凭证取自己的数。

阅读全文 »

OpenAI 提示词指南主张「从结果出发、少写步骤」,但原话后半句是「过程本身重要时就把过程写清楚」。我写了十几个串起来跑的 agent skill,结论是只对一半:选题打分这类判断活给目标就行,多环节交接的确定性流程反而得把步骤焊死,一句话就飘。

阅读全文 »

有人写了个 MessageDisplay hook,把 Claude 爱说的 load-bearing、honest take、you're absolutely right 自动换成别的词。我扒了它的机制:它只改你屏幕上看到的那一层,Claude 下一轮读回的还是原话,等于给眼睛按了静音键。真想让它别飘,得学我那两个常年挂着的 PostToolUse hook,把软规则钉成动作层的硬拦截。

阅读全文 »

卡兹克晒出每天 Vibe Coding 16 小时的流程:Fable 5 出初版、GPT-5.6 Sol 审查纠错、Codex 目标模式最长连跑 17 小时。我对照自己那条十几个 skill 的流水线,结论是多模型协作真正难的不在谁最强,在按错代价乘频次乘单价把活分对、在每个交接口堵住 agent 自作主张。

阅读全文 »
0%