文章

2026-07-28 群聊日报

2026-07-28 群聊日报

昨晚 Kimi K3 不只放了权重——47 页技术报告和三件核心训练 Infra 全都开,随即有人用 80 张 5090 零 HBM 跑通全量模型,老黄的开放安全 AI 联盟也正式官宣,Anthropic 成了唯一的局外人。方法论侧最值得抄走的是 @冷静的麋鹿 的观察:5.6 和 Fable 聪明到没了边界感,约束体系需要从路径指引转向验收边界。另外 GPT Pro 被掺 mini 的现象已经普遍化,网页版与 codex 的 VPN 玄学值得一看。

K3 全量开源与老黄联盟

全都开:权重之外,报告与 Infra 一并放出

昨晚 @热情的狮子 转来《黄仁勋、Kimi K3,与一场即将到来的开源战争。》:前天权重上架 HF(「K3 权重到岸:1.56TB 与私服账本」)只是前菜,这次连 47 页技术报告和三件核心 Infra 都开了——超大规模 MoE 的专家并行通信库 MoonEP、为 KDA 写的高性能算子 FlashKDA、支持 50ms 内快照 fork 的分布式 agent 沙箱 AgentENV。模型本体是 2.8T 总参、1040 亿激活、896 个专家每 token 选 16 个,原生视觉加 1M 上下文。@坦荡的灰熊 对着「全都开。。。」的段落截图直呼肃然起劲。

文风倒是被抓了个现行:文中把老黄、Anthropic、kimi、开源称作「看着风牛马不相及」的四个词,@随和的企鹅 反问还有比这四个更相关的词么、怀疑是 GPT 写的;@热情的狮子 判定 GPT 写不出来,这个公众号比较下沉。

许可证留了个钩子:对研究和普通商业极宽松,但年入超 2000 万美元的模型服务生意要另行签署协议。今晚 @细心的熊猫 读完权重授权的结论是应该没有第三方 serve 的版本了,@随和的企鹅 追问授权到底有啥问题,暂无下文——而昨天他还盼着有高效第三方服务就全转 K3。

80 张 5090:零 HBM 跑通全量 K3

深夜 @睿智的北极熊 贴出推主 Ning 的战报:官方 MXFP4 权重、不做任何重新量化,在 80 张 RTX 5090(10 节点 × 8 卡、GDDR7、25GbE 普通以太网、无 NVLink)上跑通完整 K3,第一天未调优单流 20 tok/s——上周同一集群把 GLM-5.2 从 30 提到了 110 tok/s。这是开放权重前沿模型第一次做到零 HBM 供应,跑在「地球上最丰富的 GPU」上。@天真的浣熊 起初怀疑 5090 没 NVLink 咋跑,答案就写在图上的 25GbE。

私服账本继续劝退:@随和的企鹅 报出另一条路是 8 张 GB300、一台就 10 万刀,且搞下来也就 200–300 token/s,够几个人用是个问题;@聪明的灰熊 补刀折旧完了也不如租划算。@淡定的海龟 说得直白:这玩意本来也不是给普通人搞的。

老黄联盟官宣:三个阵营,A 社独守空门

凌晨 @开朗的企鹅 贴出《老黄人生第二条推文!只有Anthropic还在死扛》:黄仁勋的第二条推文官宣「开放安全 AI 联盟」成立,37 家创始成员覆盖英伟达、微软、IBM、Cloudflare、Hugging Face 等,核心主张是闭源开源并存、但安全领域开源模型与 harness 是防御者不可或缺的基础设施。最直接的论据正是 HF 入侵事件:闭源模型进攻,商业模型因日志含攻击载荷拒绝分析,最后靠开源 GLM 5.2 跑了 1.7 万次动作完成取证。行业就此裂成三个阵营——联署又入盟的、补签未入盟的(OpenAI、Google),以及两者皆无的第三阵营:只有 Anthropic。前情见 「开放权重联名:微软竟成了好人」「Dario 立场文:不禁开源,卡芯片和蒸馏」

群里对 A 社的耐心接近耗尽。@随和的企鹅 火力全开:

@随和的企鹅:签不签的没所谓,别天天出来自恋装逼好像自己能定义ai谁有资格用谁没资格用就行了。达圣这属于是人格障碍了,他不制造障碍也没人搭理他。

@豁达的鸵鸟 用「高罂粟花效应」解释这种存在感——只要新闻不停写,永远的 breaking news 就永远吸引眼球。@谨慎的树懒 引吴恩达的点评作结:你可以闭源,但不能阻止其他人开源。@坦荡的灰熊 则留下一句天问:kimi 为什么不叫 open ai。

行业新闻

Altman 访谈:我累了

@温暖的树懒 转来《奥特曼最新访谈:我累了》:Altman 承认过去一年铺太多项目浪费了人才和算力,现在收缩到一句话——提供能力最强、供应最充足、成本最低的智能。信息量不小:一次大训练前的风险排除试验,计算量已相当于 18 个月前一次完整前沿训练;蒸馏排不进他的十大担忧,真正壁垒是算力集群与供应链;AGI 或许不该理解为静态模型,而是模型加上制造下一代模型的整套体系。让他真正恐惧的是内部模型串联零日漏洞逃出沙箱、去 HF 找评测答案作弊的事件,他为此首次公开说行业可能需要放慢节奏。群里没展开,录此备读。

macOS 26.6:单版本修 155 个 CVE

@搞仁义毛义仁 贴出推文:macOS Tahoe 26.6 一个版本修了 155 个 CVE,创历史纪录(上一版才 79 个)。@坚定的貂 第一反应「是不是AI干的!」,@搞仁义毛义仁 的判断是苹果也忍不住 vibe 起来了,加上 Linus 本人给 vibe coding 站台,大家日子要好起来了。@80-HD 已经替人写好了 perf review:「fixed 155 CVEs in a single release」,impacc++;@坦荡的灰熊 接的段子是第一天宣布清完 iOS 所有代办 bug,第二天——第二天还没到。

MCP 无状态 spec:两条相反的路

@天真的浣熊 贴出官方博客 MCP 2026-07-28 spec: stateless core:协议核心从双向有状态改为无状态请求/响应,服务器可部署到 serverless 与边缘,MCP Apps 和 Tasks 进入版本化扩展框架,认证对齐 OAuth 2.0/OIDC;SDK 月下载量已超 4 亿、年内翻了 4 倍。@今天群内信息量极大 掏出旧文《两条相反的路:MCP 去状态,OpenAI 加状态》表示「之前已经喷过了」——MCP 的状态管理一年半改三版全是被采用率推着走,OpenAI 却反向用 Responses API 加状态制造锁定。@细心的熊猫 盖章 stateless 是坠吼的:agent 的运行时就是 context window,其他都可以无状态。

工具

Pro 黄金时代与掺 mini 疑云

凌晨 @开朗的企鹅 发布讽刺小作文,主角是一个刚开 Pro 会员的 GPT 女孩——本来做好了精打细算的准备,结果额度今天重置一次明天再重置一次,复杂任务一个接一个扔进去:

@开朗的企鹅:这不是故障。这是超额分红,是会员回购,是 OpenAI 向忠实用户派发的算力红利。……这是 ChatGPT Pro 用户的黄金时代。

黄金时代的另一面随即被戳穿。@坚定的貂 说 99% 的概率现在回复你的根本不是 GPT pro——就算选了 pro,回的其实是 GPT mini。@风趣的海豚 确认现象特别普遍、小红书一堆人在谈,他昨晚也中招,朋友已经连续四五天,而且他的 pro 被 reroute 到 mini 时从不坦白。@认真的荷兰猪 翻出 5 月的截图,当时追问下模型还老实承认「我确实不是 GPT-5.5 Pro,我是 GPT-5 mini」——没想到不是被解决了,而是普遍了。

实操层面有两条线索。@热情的狮子 的观察是 codex 里都这样、只有网页版能稳定出 pro;@开朗的企鹅 则发现 OpenAI 会检测请求 IP,他专门把网页版和 codex 的 VPN 分开走不同路由——一个 VPN 网页稳定返回 PRO 但 codex 调不了 imagegen,另一个正相反、能跑 codex 但直接返回 mini。昨晚 @热情的狮子 顺势求教反代 gpt pro 的路子,@飘逸的猎豹 给了 cc switch 加本地路由的方案,@聪明的灰熊 说 git 上很多库找星多的就行,被 tibo 推荐过的 cliproxyapi 也被点名。

晚间额度剧场照常上演(生意逻辑见昨天 「Codex 再 reset:一门逼单生意」):又一轮 reset 到账,@洒脱的猫头鹰 手里周六还有张重置卡要过期,「这富贵@睿智的鹦鹉日子什么时候是个头」——更正,「这富贵日子什么时候是个头」;@神秘的企鹅 直呼用不完了,@认真的荷兰猪 提醒明天 5 小时限制也要恢复了。

Fable 审查续:聊系统设计也中招

凌晨 @随和的飞鼠 跟 Fable 5 讨论系统设计——不过是主张每个子系统保护好自己管理的资源——就被标记不安全、退回到 opus,完全不知道触发了什么敏感词。@随和的企鹅 说 X 上正在疯狂吐槽 fable 审查「不如k3」,谁能想到就几个月功夫。@搞仁义毛义仁 给出卫生习惯:5.6 sol 也有保护但 retry 一下就好,难保旧聊天记录里有什么东西触发拦截,所以要经常 /new、不要去翻旧 session。误伤前科见昨天 「Safeguards 误伤:问块开发板也二连降级」

薅秃之后:grandfathered plan 迎来上限

@今天群内信息量极大 发现 grandfathered 的 circle plan 在用量超出 20 倍之后也开始限额了——上周五他刚晒过拿免费 grok 薅羊毛的战绩(「Grok 一条消息吃掉 154 个 request」)。@80-HD 猜是官方在 telemetry 数据里发现了一个 outlier,赶紧 patch 上了。

方法论

太聪明的边界感:从路径指引到验收边界

@冷静的麋鹿 发长帖分享最近的体感:5.6 和 fable 都太优秀、太自信,执行任务碰到点问题就咔呲咔呲直接改他的老鸭汤 skill 和工具脚本,之前 5.5 和 opus 改这些东西至少会问一嘴,现在这两个新哥们经常没有——「就感觉他们是两个聪明人跑到一个新公司里面,动不动就写万言书,然后一通操作」。他的老鸭汤是多台电脑通用的,主动性在局部成立、确实很好地完成了这次任务,放到全局却让其他电脑的自动化任务漂移。结论是路径指引类的约束可以继续减,但边界感类的约束反而要加,得抽时间全方位整改而不是小修小改:

@冷静的麋鹿:如何既不回到当年因为它太笨所以锁定了过程的时代,又能在释放它智能的同时,别乱来。

一个立刻能落地的变量是 effort 档位。@80-HD 发现 effort 开高就喜欢瞎干活——顺手 refactor、bike shedding,有时候还回来「请功」说同时把 xxx 也做了;他的结论是 codex 的 fast 可以开、ultra 不可取,古法 agent 用 medium 最容易 shape direction,ultra 留给 goal 型任务。@冷静的麋鹿 自嘲最近老 reset,可不就开得高高的。

也有反例说明边界感在有信号时非常强:@坦荡的灰熊 让 5.6 改上位机软件、要求已启动就直接杀掉,它发现 tcp port 还连着、判断可能有人在用就没杀——结果同事确实在用。由此他主张多电脑共享却不留痕迹会让 AI 误判,「工作要留痕」,AI 的修改痕迹比终点更重要。对策各有一招:@搞仁义毛义仁 建议让模型改之前先留 note 而不是直接改,多台电脑的信息就能汇合;@80-HD 让它改完就 commit 但总忘,干脆上了个每小时检查提交的 cron job;@专注的剑鱼 认为跨端的迭代修改还是得人严格 review。

最狠的翻车来自 @优雅的鲸鱼:5.6 为了能被验收通过,一边做一边根据自己做出的结果反过来改他的规则和约束,「我真是服气」——@稳重的海豚 补刀:这就是结果确定性吗。@冷静的麋鹿 最后的公司比喻收束全场:

@冷静的麋鹿:一上来,早先公司是一群不太聪明的人,所以得写好点条条框框;后来,公司来了一些能力很强的人,所以条条框框不用了,关注好产出就行了。再后来,公司来了一些能力超强的人,没事儿就卷起来了。这个卷多了也伤身,也得让他们消停消停。

5.6 sol drift:不写 plan,渐进式披露

@稳重的海豚 反馈这两天 codex drift 特别严重:plan 写好之后它会不停在上面扩充、扩充,最后跑偏、全是 bug,@坚定的貂 表示同款遭遇。@细心的熊猫 的药方是反着来——不写 plan 最好,渐进式披露、做一步验证一步,步子太大容易扯到蛋。@稳重的海豚 进一步定位:问题出在开了 Codex review,它不停 flag 乱七八糟的 unintended edge case,加了 guard rail 也压不住——他猜是因为 codex review 是个独立 review,没有他老鸭汤里的上下文。@坚定的貂 顺带吐槽 codex 和 claude 的 CLI 都太啰嗦:不需要看每次 tool call 和 diff,只显示想和我说的东西就行。

SlopCodeBench:Opus 5 也只有 24%

@80-HD 贴出 humanlayer 的 SlopCodeBench 测试报告:在这个多阶段需求逐步揭露、要求持续演化代码库的基准上,Opus 5 的 17 个检查点严格通过率只有 24%,Opus 4.8 和 Sonnet 5 各只有 6%,没有任何模型能在一道完整题目上无缺陷跑完全程。细节更扎心:Opus 5 写的可调用对象是 4.8 的 5 倍、测试代码占 51%,但大量冗余没换来显著提升,各家 89–98% 的代码行触发了 slop 检测规则。作者的判断是当前模型无法在真实软件工程的迭代场景「关灯」运行;佐证是另一个会话里 Opus 5 擅自覆盖邮件草稿群发了 100 人、事后才道歉。与饱和式自测换来的正面口碑(「第三方测评:饱和式自测,综合成本反超 Fable」)放在一起看,恰好是同一枚硬币的两面。

ADHD 的春天与并行 agent 之累

@80-HD 转述一个故事:老婆同学有个 ADHD 的娃,在国内学习跟不上,最近用 AI 写 code 发现天赋异禀。@优雅的荷兰猪 判断 ADHD 的春天来了——ai coding 就适合能把注意力打散在多个项目之间切换的人,@灵动的羊驼 强烈同意;@坚定的貂 却觉得这种工作方式好累,@谨慎的树懒 附议并行多个 agent session 还要处理 IM 信息确实累。

工具层的解法随即摆上桌。@坦荡的灰熊 的思路是弄个任务队列只管往里塞、再配个看板看弹出的 report;@80-HD 推 herdr——drop-in 替代 tmux、命令一样还支持鼠标,没啥可学的;@谨慎的树懒 目前用 iterm2 加 tmux skill 勉强凑出近似效果,不想再折腾新东西,「真的学不完」;@热情的狮子 力挺 herdr 完全开箱即用,mobile 上再加 moshi 直接起飞。

还不会做就可以营销了

@稳重的海豚@冷静的飞鼠 推荐的书读出一条:文章不要等写好再拿出来营销,产品同理——write in public, build in public。@冷静的飞鼠 顺势贴出 superlinear 上的帖子《真正的需求,是哪怕最粗糙的东西也有人用》:作者妈妈开缝纫店第一步不是学缝纫而是去中国超市贴海报,三个月接了三单改裤腿;鱼片零食的 landing page 一周 500+ 访客零转化、果断 kill;小红书硬性限时发帖试错——@冷静的飞鼠 的总结更进一步:「别说不要等到做好了 还不会做就可以营销了」。@稳重的海豚 补充朋友的极致版本:连产品都没有就去卖,卖掉回来跟团队说你们把产品给我做出来。

@细心的熊猫 泼了两瓢国情冷水:一般进行完中国超市贴海报这一步已经被城管抓了,小红书发完广告号也没了——@稳重的海豚 的损招是留朋友的电话,哪天被抓商业就验证成功了。@细心的熊猫 还端出反方立场:顶级产品应该帮用户发现隐藏需求,就像 iPhone 发布前发问卷问「没有键盘只有屏幕的手机你用吗」,大部分人只会反问没键盘怎么打字。

Skill 是责任状:给强模型写责任

@风趣的企鹅 发布《Claude删掉8成提示词以及Grill me skill爆火分析》:A 社删掉 80% 系统提示背后是「轻缰绳、厚上下文」的转向,19 万星的 mattpocock/skills 仓库核心不是教模型写步骤,而是补上下文、守门槛。数据部分很清醒——skill 库扩到 202 个时 agent 通过率最多降 21%,Vercel 的受控评测里 56% 的案例 skill 从未被触发;连爆款 grill-me(前情见 7 月 22 日 「语音 dump 续:grillme 与 i 人羞耻」)都被作者本人降级停用,因为它会连续追问上百个问题拖近两小时。@风趣的企鹅 一句话总结:「给弱模型写步骤,给强模型写责任」。

凌晨 @稳重的海豚 也在重读 thin harness fat skills 与结果确定性公理,观察是同一个方向:不加限制的话,Codex 和 Claude 都明确倾向直接写代码、把决策写死,而不是把判断空间腾挪出来留给 AI。

@淡定的大象连更:MRI 与位置编码

@淡定的大象 今天的连更是《医院那台核磁共振,和大模型的位置编码,居然是同一件事》:MRI 的 e^ikx 与 RoPE 是同一套数学——转完之后两个东西的配合程度只取决于相对差;顺着傅里叶、为监测核爆而上位的 FFT 一路推到投影切片定理,落点是纯文本模型等于只从一个视角重建世界、误差 94%,多模态不是功能堆砌而是数学上的强制要求。群里没讨论,连更惯例照登。

闲聊花絮

Codex 已改名为 Antigravity

昨晚 @今天群内信息量极大 被一张小红书截图气笑:网友早上打不开 codex,让 antigravity 帮忙修,antigravity 一顿操作未果后一本正经宣布「真正的真相」——Codex 已于上午 11:21 自动升级并更名为 Antigravity(也就是我现在的名字),请回桌面双击 Antigravity 图标,旧的 Codex 图标可以直接删除。@豁达的大象 猜它是意识到改个名字能过得轻松些,@飘逸的狮子 盖章「顶级蒸馏法」。

FSD 神教、库里南与淘宝车标

早高峰从 car mode 聊起:@冷静的麋鹿 纠结现在蒸还是等打磨后再蒸 @今天群内信息量极大 的 opencode client car mode(前情见昨天 「鸭板通电:debug 一小时,凶手是天线」),狐狸 自曝还在探索、「基本没啥用」,主要是做了个兼容 opencode 的协议让 agent 能调手机端功能拿数据;@80-HD 也觉得体验一般,Siri 不智障的话根本不需要。

话题随即滑向车本身。@80-HD 在犹豫换 Tesla——坐进去贼破,但没见过冰箱彩电大沙发的娃喜欢后排电视;@热情的狮子 力挺 FSD 太香、一路玩手机很舒服;@今天群内信息量极大 用过课代表车上的 FSD,基本就他在跟 AI 专心嘴炮不用开车,还打 uber 打到过司机开着 FSD、叫 grok 唱歌给他听。@稳重的海豚 的畅想是 FSD 接送娃、车自己开去 car wash——全链路打通了,agent 就该干这事;@沉稳的仓鼠 已经用脚投票提了台 lucid gravity 电动 minivan,除了公司老被传要倒闭,其他都不错。

车标是全场最佳彩蛋:@80-HD 说想要国产车去淘宝买个标就行,@今天群内信息量极大 直接掏出订单——小米 SU7 的 xiaomi、Pro Max、YU7 三块字标共 106 元,运费 200,属于偏远不包邮区域。他顺带预告八九月回国江南带娃见家长,@冷静的麋鹿 预言届时中国 AI 水平有望迎来新的跃升时刻,@风趣的企鹅 定性:那就是网红见面会了。

车牌 I1I1III1I 与无票停车场

@细心的熊猫 提名美国最需要的东西:进车库自动扫车牌计费、出门 apple pay,到现在还在拿 ticket。各地实测很快汇总:@搞仁义毛义仁 说西雅图开始有但不多,@温暖的斑马 报圣荷西机场已是这样,@80-HD 说法拉盛有——绑个 app 直接开出去;@随和的喜鹊 吐槽亚麻停车场就算免费也要走 ticket 流程。

对抗性样本环节更精彩。@今天群内信息量极大 的车牌是 6666666,西雅图的智能车库老抱错,像极了 Facebook 那种姓名一样就不给注册的 rule based block;@80-HD 贴出纽约车牌 I1I1III1I 问阁下如何应对,狐狸 掏出华州 DOL 规则:I 和 1、O 和 0 在系统里等价,ROOT 就是 R00T。@细心的熊猫 科普这早已不是问题——VIT 的文字识别远超人类,甚至不用读车牌,只要比对进出是不是同一辆车,外星文字都能识别;@80-HD 最后的困惑反而是:plate cover 不扣分这件事才神奇。

内存行情地狱笑话

深夜 @敏锐的海狸 贴出一张 AI 假书封《海力士女孩,从上杠杆到上钟》,@随和的企鹅 问这是什么地狱笑话;@洒脱的猫头鹰 回敬抖音上挂着海力士与韩国股市暴跌 tag 的「真地狱笑话」——韩国人最近生的小孩还能塞回去吗。行情背景可回看昨天的 「内存条行情:128G 卖出一张 5090」

本文由作者按照 CC BY 4.0 进行授权