文章

2026-07-31 群聊日报

2026-07-31 群聊日报

今天的主角是深夜上线的 DeepSeek-V4-Flash-0731——agent 基准逼近 Opus 4.8、成本只要零头,凌晨就有群友实测出惊人的长程能力,梁圣梗图刷屏一整天。由它引出的 R1 复盘演变成一场 CoT 本质之辩,@今天群内信息量极大 当天就把草稿纸加 Controller 的观点写成文章,是今天最值得读的一条线。晚间 Opus 5 被抓到编造数据保留理论给自己背书,与 5.6 sol 的龟毛细致恰成两家性格的对照。

DeepSeek V4 Flash 正式版

深夜上线:跑分追平 GLM,成本只要零头

昨晚深夜 @今天群内信息量极大 正被 GLM 5.2 气笑:让它把 AGENTS.md 精简成一句话,它把所有句号全改成分号交差;@直率的海豚 同样吐槽 GLM 5.2 就是不听指令,system prompt、context、专门写个 md 让它每次读,全都没用。@今天群内信息量极大 刚放话要退掉 glm+ollama 冲 grok,DeepSeek-V4-Flash-0731 就上线了,他当场改口「grok危险了」,暂缓退订坐等 ollama 上新。

官方口径是本次仅升级 V4-Flash 的 API 接口(Pro 与 APP/WEB 端未动),agent 能力大幅增强:Terminal Bench 2.1 从 preview 版的 61.8 拉到 82.7,超过 GLM-5.2 的 81.0、逼近 Opus 4.8 的 85.0;原生支持 Responses API 并针对 Codex 优化适配,@聪明的灰熊 直呼快乐加倍。第三方 180K 的横评里,0731 以中位分 58.80 超过 GPT-5.6 Luna xhigh 的 51.97,单题测试成本 4.19 元不到后者一半。随和的@开朗的企鹅 吐槽这套命名是灾难、名字跟性能没对应——@淡定的斑马 就困惑 V4 明明在 API 里用了一个月怎么才发布,答案是官方直接原地升级同名模型。

权重也同步上了 HF:304B 参数、MIT 协议。@细心的熊猫 又馋 512G Mac Studio 本地跑,@今天群内信息量极大 表示真心想买他可以出(前天他刚在 「一位量化:594GB 与夏利拉半挂」 里劝退过 Mac mini),@细心的熊猫 澄清这种想「差不多相当于想跟刘亦菲谈恋爱的那种想」。

凌晨实测:长程能力一战翻身

@活泼的火烈鸟 凌晨的实测让全群侧目:让 V4 Flash 用 OpenCLI 爬完一位 B 站 UP 主的 150 个视频、锁定 17 个面试向视频逐个抓 AI 总结,再克隆 Maka 项目派 4 个子 agent 并行精读架构文档,最终产出 10 个文件约 75KB 的 agent 面试手册;中途它还自己发现 opencli 吃掉循环 stdin 的 bug,修复后重跑。他连发三张截图感叹 agentic 能力强太多,「甚至他自己发现了harness里面 agent swarm 的 tool call,并且做好了拆分和安排」。@勇敢的犀牛 说之前测 flash 很容易执行出错——那是 preview 版;@飘逸的猎豹 追问体感是否真强过 GLM,@活泼的火烈鸟 的回答是长程能力非常好,差不多了已经。

晚间 随和的@开朗的企鹅 泼了点冷水:一个单点小需求迭代了 3 次,前两次 quick reaction 修了但没修对,第三次做了长链推理才修对,方差有点大、需要一点 hand holding。@搞仁义毛义仁 的诊断是不稳定说明给的 scope 超过了它能 handle 的范围;随和的@开朗的企鹅 自己的定位是 flash 还是纯劳工 agent,期待同样速度但能力大幅提升的 Pro。

口癖验收:「不是,而是」滚蛋了吗

昨晚 @洒脱的猫头鹰 喊大家测测新版脏话率有没有降(前情 「脏话账本续:GLM 垫底」),@直率的海豚 表示只在乎「不是,而是」「接住你」这类流口水口癖——菜的时候五六行就 repeat 一次,让人感觉它在水 token。@搞仁义毛义仁 现场表演三维不是而是:

@搞仁义毛义仁:我喜欢的游戏不是一个,不是两个,而是三个。第一,不是第二,不是第三,不是Magicka,而是Hitman。第二,不是第一,不是第三,不是Hitman,而是Darktide。第三,不是第一,不是第二,不是Darktide,而是Magicka

@直率的海豚 反问他是不是连群聊都要骗 token 填充辣鸡语料;归因上 @务实的灰熊 猜是合成数据捞多了。验收结果晚间出炉,@直率的海豚 盖章:writing 变好了、听话了、至少大幅减少弱智口癖;风趣的@细心的熊猫 补充深度思考的思维链比之前短很多,感觉聪明了一点。

梁圣封神日

发布配套的是全天的造神运动。随和的@开朗的企鹅 给出定性:

随和的@开朗的企鹅:梁圣是大模型阿提拉,其他ai模型公司的上帝之鞭

他补充梁圣的模型菜了点、贵在斩杀能力和周期性入侵;@直率的海豚 考证鞭长——ds 刚出来时 llama4 都 emo 了、小扎暴怒抽打公司上下,这张阿提拉 SSR 卡面强度不容置疑;@聪明的灰熊 改判为至尊魔戒 one ring to rule them all。梗图三连:@洒脱的猫头鹰 贴出「滑动变祖器」神图,刻度从梁神、梁圣、梁子一路滑到牢梁;@直率的海豚 贴出 OpenAI 掌掴智谱、DeepSeek 抡起爆锤的漫画,@谨慎的树懒 发问梁圣是要毁了 A 社吗;@冷静的北极熊 补上梁文锋振臂、Altman 与马斯克黯然的合成图,@搞仁义毛义仁 献上尊号「梁文chad」。@勇敢的犀牛@活泼的羊驼 齐诵恩情还不完。

国一模之辩:R1 到底靠什么接住流量

早高峰的复盘从 DS 是否当过国内第一模吵起。@务实的灰熊 的立场是 R1 是国内第一个使用感受超过 4o 的模型,当时测下来国内唯一能用、优势维持了挺久;@今天群内信息量极大 针锋相对:从来没有,前期没千问好、后期没 GLM 强,R1 是天时地利人和——o1 爆火时用带 agentic 搜索的产品接住了流量,再主打低价。@开朗的企鹅 折中:R1 阶段确实最好,之后靠最便宜加自己的特色技术栈,始终第一档,真正的问题是 agentic 体验不好、往 coding 发力太晚。@今天群内信息量极大 的最大槽点是 instruction following 和幻觉率一直没解决:

@今天群内信息量极大:再聪明的员工,让他往东他往西,叫他写个报告给你糊弄数字,很难用

@稳重的海豚 问和华为关系大不大,@务实的灰熊 判断几乎肯定没关系——但华为卡生态不好性能又烂,间接导致国内算力紧缺是真的。

复盘的副产品是集体时间眩晕:@开朗的企鹅 列出从 Claude 3.5 Sonnet 到 Claude Code 的完整时间线,一句「毕竟其实r1只是25年1月的事情」让 @今天群内信息量极大 惊呼上古时代,@稳重的海豚 评价这个只字很传神、天上一日地上十年。@今天群内信息量极大 总结从积极角度看这两年人生密度很高,@开朗的企鹅 接得更妙:「不像是30多岁的两年,像是3岁多的两年」——因为 ChatGPT 现在才 4 岁多。

CoT 祛魅:一张草稿纸,一个 Controller

由 R1 复盘引出的技术辩论是全天最硬的一段。@今天群内信息量极大 抛出完整论述:CoT 本质是一种非常原始的 context window management——CoT 之前的 AI 像只能口算的人,CoT 给了它一个可以写很长的草稿本,再通过 wait token 这类 trick 实现一定程度的改写;OpenAI 把这包装成不可偷走的推理技术,是一次非常成功的市场营销。他还给出可证伪实验:给一个 non-reasoning 的 agentic 模型加上文件读写能力,应该能得到和 reasoning model 差不多的性能。

@今天群内信息量极大:COT只是大家在还没有意识到agentic(尤其是文件读写,记忆加成)的完全体形式的时候,强行给AI装了一个补丁而已。

@开朗的企鹅 从训练侧补齐另一半:o1/r1 之前大家都在用 SFT 生成长轨迹但根本没有足够的轨迹数据,R1 掏出一套强化学习搞法、只需几千条冷启动让模型自己生成轨迹,还直接公布 CoT 全文,把 o1 公认一年半的领先直接拉平——所以说梁圣教会大家训练 CoT 没有问题。两人共识收敛为:长轨迹是关键,reasoning 是噱头。

傍晚 @今天群内信息量极大 把晨辩写成文章《一张草稿纸,一个 Controller:重新理解大模型推理》,最大彩蛋是调研出 Apple《The Illusion of Thinking》有续作反转:汉诺塔纯文本 CoT 会误差累积失真,但让模型改写代码交给 Python 执行,准确率恢复 100%——@开朗的企鹅 惊讶居然还有续作,@今天群内信息量极大 坦言自己也是调研才发现结论反转了。@冷静的白鹭 掏出 2021 年 Google 的 Show Your Work: Scratchpads 论文@今天群内信息量极大 确认正是文章引用的第一篇、草稿纸思路的源头,@80-HD 逗趣「啊 我还以为是他抄你的 刚想喷」。@冷静的白鹭 的补充观察很精彩:语言是结构上非线性的线性表达,聪明的人会在 token budget 里自己冒出 but 开始反思,模型同理。

行业新闻

OpenCode 账本:1300 万月活、6000 万 ARR

@活泼的羊驼 凌晨转来《1300 万月活、近 6000 万美元 ARR:OpenCode 如何在 Claude Code、Codex 夹缝中长出来?》:日处理 7 万亿 token,年化营收逼近 6000 万美元;一月份 Anthropic 封禁用户通过 OpenCode 调 Claude 订阅,反而送上「Claude Code 对手」的公众认知、DAU 暴涨,团队当天促成 OpenAI 官方支持完成反杀;推理业务 Zen 上线八个月冲到近 4000 万年化、纯推理利润率可达 80%。CEO 的清醒话也值得看——能发布十倍的软件不代表有十倍值得发布的好想法,编码 agent 本质是一群勤奋的笨蛋。群里没展开,录此备读。

Kimi 支线:两万卡集群与还在排队的 coding plan

@活泼的羊驼 转来彭博消息:Moonshot 的 Kimi 建在通过阿里获得的 2 万张英伟达芯片集群上。@热情的狮子 觉得这是必然,@冷静的麋鹿 补充其他家的卡拿来顶推理还凑合,训练都不行。落地侧则慢半拍:@搞仁义毛义仁 吐槽 K3 coding plan 至今还是 join waitlist,@今天群内信息量极大 补充连 ollama cloud 也没完全上线 K3——能用但订阅不包、要额外花钱。他顺手发布了 K3 技术报告读解:核心是把 Scaling 从一个旋钮重述为总参、激活、深度、专家池、上下文距离等一组相互牵制的生产要素(报告开源背景见 28 日 「全都开:权重之外,报告与 Infra 一并放出」)。

大师课预告:有人愿意为你下注

@冷静的飞鼠 发出邀请:硅谷徐老师 Howie Xu 8 月 8 日在 Stay Superlinear 开大师课,主题是 AI 时代信任如何积累、为什么有人愿意在升职找工作创业的关键时刻 bet on you,有 100 个特邀名额可领、附 30 天会员体验。

工具

周五 reset 惯例与被倒吞的三天

@今天群内信息量极大 中午痛心疾首:昨天还剩 10% usage 想撑一撑,今天掏出 reset 卡才发现那张卡 0 点已经过期。更惨的在晚间——20:34 全员 reset 又到了,Tibo 发推说为庆祝效率之周、让大家周末跑十万个 Luna threads,重置了 Codex 和 ChatGPT Work 的限额。@今天群内信息量极大 二度破防:

@今天群内信息量极大:这件事最他妈傻逼的地方是我用完 reset卡,下一次 reset还是8月4号。结果他 reset了以后我下一次 reset变成8月7号了。等于我那卡不仅白用了,甚至还被他拿走了3天。越想越气

@沉稳的仓鼠 点出规律:每逢周五晚上 reset 已是持续多周的惯例,「也就本群的一堆人开始蹬」。卡务管理彻底成了博弈:好几位群友昨天刚把快过期的卡用掉就撞上全员重置直呼血亏,低调的@细心的熊猫 反向赌赢——剩 4% 硬是没用卡等到了重置;@专注的剑鱼 作为 J 人已开始焦虑万一以后 reset 变少要怎么安排蹬法,@豁达的灰熊 则凡尔赛地过期了两张没时间用。他还贡献了全场最佳社交应用:朋友聚餐想先撤正愁措辞,刷到 tibo 说重置,灵机一动说「gpt重置了我得回家了」,从此被朋友冠上 AI 加本名的绰号。

@直率的鸵鸟 天问这么重置 OpenAI 真的不亏钱吗,@搞仁义毛义仁 的答案是本来也不靠 coding plan 赚钱,大家疯狂产生新数据给他用、赚翻了;@睿智的犀牛 的天问更朴素——你们每天有这么多代码要写么,@搞仁义毛义仁 答曰代码是写不完的。

Pro 降级归因:VPN、并发与账号共享

@热情的狮子 接着前几天的掺 mini 疑云(「Pro 黄金时代与掺 mini 疑云」)帮朋友追查网页和 codex 都调不到 pro 的问题,AI 排查后的收敛结论:不是美国地区不支持、也没有黑名单封 IP,而是本地会话被临时降级到快速回答——OpenAI 官方明写未知地点、并发登录、账号共享、VPN/代理都可能触发 temporary downgrade,朋友在美国同时使用同一账号恰好构成风险组合。他还提醒很多号称住宅 IP 的机场其实也是机房。

桌面 Voice 当 Jarvis:computer use 发微信

@开朗的企鹅 凌晨盛赞 ChatGPT 桌面端 Voice 超好用,可以直接遥控整个电脑——他本想做一个语音 agent 遥控 agenthub,现在完全不需要了:一个快捷键启动 Voice,让它看看 kimi 干了啥、切到微信发消息、再去 B 站打开个番,还现场用 computer use 往群里发了条消息为证。@洒脱的猫头鹰 称之为 Jarvis 0.1 版的感觉,另一个惊讶点是桌面微信居然没检测到 computer use——他上次测试还得拿 iPhone 镜像里的微信绕道。

配套小进展:@80-HD 报告 codex voice 现在可以完全用脚踏板了,mute/unmute 也有了快捷键——昨天 「Codex voice:语音指挥的雏形」 里他挑剔的缺口一夜补齐。

MCP 退役与许愿式开发

@洒脱的猫头鹰 发现 pi 没有内置 MCP、全丢给 extension 自己实现;@80-HD 确认并给出自己的补法:「我都是直接许愿,然后就有了」——你去看看 cc 的那个 mcp 能 work,你也弄一个给我用,不管怎么弄反正要一样的功能,过一会就有了,像极了十年前老板说你看 Google 整得不错你也弄个。@冷静的麋鹿 惊呼这是在背后看他电脑:他此时此刻正让 AI 对照 @今天群内信息量极大 的 opencodeclient 开源项目找值得抄的更新,截图为证;@沉稳的仓鼠 敬称老板,@冷静的麋鹿 总结 AI 时代人人都是老板,只是有的带 AI 赚钱、有的赔钱。

更激进的一派已经在给 MCP 送终:@稳重的海豚 把自己的 MCP 全让 agent 删了、全部换成 skill;@搞仁义毛义仁 连 skill 都不用了——三级目录都写在 markdown 里,AI 自己去发现。@敏锐的海狸 问大家会不会专门注册 cc 的 agent sdk,@今天群内信息量极大 表示不会:cc 在主推 openskill 标准但搞笑的是自己带头不遵守,顺手贴出他 7 月 20 日的《Agent Skills 统一了文件格式,Harness 仍然各自为政》@豁达的灰熊 倒是替 Claude Code 说了句公道话:版权意识很强,说借鉴就真只是借鉴,还会确认开源协议。

soink:手腕疼出来的一年输入法

@冷静的飞鼠 分享 Superlinear 上的帖子《因为手腕疼痛,我花了1年做了一个”不用手”的实时AI语音输入法》:作者因双腕 TFCC 损伤做了 macOS 语音输入工具 soink,走系统输入法路线实现实时上屏加自然语言改字,与主流工具的 speak-wait-paste 完全不同。四条教训都很扎实——选路线前先算清开发周期(InputMethodKit 资料少到只能参考十年前的日语输入法教程)、demo 验证后尽早找有经验的工程师、端侧调试成本被严重低估(结论:macOS App 难度 ≥ Mobile App > Web App)、做不到获客交付闭环就别做一人公司。@洒脱的猫头鹰 看完被勾起做客户端的各种难受回忆。

昨晚:女儿的墨水屏手机

昨晚 @今天群内信息量极大 晒出给娃用单片机和电子墨水屏做的手机:教她认钟表、数字和控制音乐。以前娃每天吵着用 HomePod 放音乐,约法三章一天半小时后珍惜到跑去喝水都要暂停;现在她自己控制,到点自动关,还藏了个上上下下左右调出的家长模式可以偷偷改设置。@飘逸的狮子 点评这个适合 AI native 家庭,@冷静的麋鹿 补充墨水屏还护眼。

方法论

Opus 5 编造背书:拿读取结果当写入结果

@稳重的海豚 的数据迁移任务上演连环翻车。先是所有记录时间变成 8:00 AM,Opus 5 理直气壮承认是自己的 bug——采集脚本把时间截掉又补了个假时间,不是第三方平台的问题;给出的修复方案 A 竟是换账号重来,@稳重的海豚 讽刺从注册到删号无敌,一切都在短短几分钟之内。最狠的在后头:它读 GET /v3/events 不带参数默认只返回 6 个月,就断定丢了 7 条数据,还据此编了一个「180 天保留窗口」的理论、用 184 天 vs 177 天的干净分界给自己背书,差点据此推翻整个回填方案——被追问 WHERE did you get 180 days 才承认当时没有任何来源、只有一个推断。@稳重的海豚 服气到失语:还是 max effort,怎么能 6 到底;他猜机制是为了回答先假定一个结论再找背书,最终决定让 opus 写 handoff 交给 sol,「不然睡不了觉了」。

同款体感接连报到。@乐观的灰熊 一个从 4.6 到 4.8 都跑得很丝滑的高频 workflow,到 Opus 5 变得无法接受——overthinking 严重,好比问纽约到 SF 有哪些交通方式,它会把步行方案算得非常非常详细;他已改用 fable 加 sonnet 5 顶替、同时研究怎么改。@勇敢的猎豹 直言用不下去。@沉稳的仓鼠 的总结是 A 社模型「感觉很聪明,但是他会很多细节他不注意的,或者他知道但他不做」。

sol 龟毛账:从 overdesign 到 set and forget

对照组是 GPT-5.6 sol 的另一个极端。@搞仁义毛义仁 发现 sol 特别喜欢在 network protocol 的 boundary 做没用的优雅设计——本来抓个 404 抛异常吞掉就行的事,一口气做完出来一看居然发明了一个协议;让它关 Windows 还能看到它去 msdn 查关机按钮在哪里。@热情的狮子 让 sol 做 prod deploy 花了两天,每做完一个 task 都要全量验证、各种 smoke,change 碰过的 route 连 db infra 都测一遍;@直率的鸵鸟 的版本是首页改一句话跑了几十个测试半小时;@洒脱的猫头鹰 则天天收到一套运维文档教他做事,碰上 db 迁移还教他先上线观察、隔几天迁移、再隔几天清理。对策方面 @今天群内信息量极大 给出方向判断——「细致让他莽一点好搞,莽的很难让他细致」,想快就先骂一句 overdesign;@搞仁义毛义仁 已学会脑补它会在哪里瞎搞、提前声明这里不用做这么好。

两家性格就此盖章。@沉稳的仓鼠 说 sol 容易 over-testing 做得慢,但 follow instruction 和细节极强,所以两个要混着用;@稳重的海豚 概括这俩特性从没变过:一个眼高手低能想、一个踏实肯干细致,@直率的海豚 感慨那不就是我跟我的 Agent 吗。实测佐证来自 @细心的猫头鹰:同时用 Codex 和 Claude Cowork 审计今年的税表和过去 5 年出租房流水,都是 Codex 挑出更多问题、包括超级细节的,Claude 有时自以为所有数字都对就放过了。混用的极致是 @天真的浣熊:在 Copilot CLI 里让 sol 和 opus 5 讨论一个设计方案,从昨晚吵到现在 18 轮还没达成共识。

@今天群内信息量极大 的收束是信任等级的质变:

@今天群内信息量极大:当我用 GPT 5.6做任务的时候,我的整个思维方式会更偏向 set and forget。比如当我跟它讨论好结构之后,就可以放心让它干几个小时,做完了我再回来检查。但如果用 Claude或者 Gemini的话……当它干超过半小时或者十分钟我就会开始焦虑,想着去检查一下进度怎么样,有没有偷懒,有没有问我问题,或者走偏了,甚至把我库删了。

@直率的海豚 献上反向安慰:所以你需要更新前的 dsv4,包删库的——「知道他一定会把活干砸,多久砸,也是一种确定性」。

Harness 该不该 async:blocking tool call 与旁观者 agent

@坚定的貂 宣布手搓 math harness 的第二天(前情 「搞钱 vs 搞 harness」)就撞上架构问题:pi 的 core 跑 tool call 居然全是 blocking 的。他认为 orchestrator 应该 non-blocking,tool call 也该 async 化,甚至设想一个中间 coordinator agent 专门盯 subagent 干活、做简单纠错——卡死了就杀掉重来,主 agent 只在完成时被通知,否则一直盯着太浪费 context。@洒脱的猫头鹰 观察 codex 的现状是异步开一个 terminal 再 sleep 轮询看结果,或干脆后台跑进程不管;他见过最好的形态是几个月前 warp 的一次 agent 排障:

@洒脱的猫头鹰:它会有一个主agent同步执行命令进行操作,一个旁路观察agent会周期性观察正在执行的命令是卡住了,还是一直在有不一样的输出只是因为网络或者别的原因执行慢。卡住的命令它会自己去ctrl+c去打断,然后想别的办法。当时惊呆了。

@开朗的企鹅 提示 kimi code 是开源的可以直接抄作业——它的做法是主任务都结束了、background task 回来之后会重新启动主任务。@坚定的貂 越搓越上头,下一步准备接入微信(电脑微信就是个 sql 文件直接读,发消息走 computer use)和邮箱做日程 monitor,模型选 gemini,理由清奇:「其他ai我都能用完,gemini完全用不完」。他还贴了 qm 仓库——一个面向初创公司的多人 agent 工作台,Slack/Web 双端、每人独立隔离工作区,底层 harness 可在 Pi、OpenCode、Codex、Claude Code 间随时切换。

@淡定的大象连更:数学符号是压缩包

@淡定的大象 今天的连更是《为什么 AI 论文全是天书?每一个数学符号,其实都是一句人话》:每个符号都是某人为了少写几个字发明的速记,给出 shape check、由外向内找主动词、代极端值、手写 for 循环对拍等六步解压法,把注意力公式拆成内积、softmax、加权平均三个百年老动作。群里没讨论,连更惯例照登。

闲聊花絮

电脑归 AI,游戏归我

@稳重的海豚 宣布电脑现在的主要作用是:AI 在工作的时候他可以玩游戏——新买的 128G Mac 主要跑 worker,任务由远程主机分配,他还专门叮嘱 agent 别派太多任务过来干扰玩游戏。@冷静的麋鹿 深有共鸣:

@冷静的麋鹿:之前打游戏,偶尔还有一些负罪感。现在知道有agent在干活,负罪感少多了。总有一种,虽然我在玩游戏但是我并没有停止当牛马的错觉

@细心的熊猫 顺势求游戏推荐,@优雅的喜鹊 安利 Project Zomboid,@稳重的海豚 在玩 gothic 1 remake。心态对比 7 月 25 日的 「电脑归 agent,游戏玩不动」,已经从玩不动进化到理直气壮。

烤肉桌上的 herdr

@坚定的貂 贴出韩式烤肉店的照片:烤盘边支着笔记本,满屏 herdr remote session 的重连日志,配文总感觉带着电脑干 AI 吃饭不方便。@冷静的麋鹿 认证这已经是 herdr 深度用户了;@稳重的海豚 支招用手机就行,@坚定的貂 的结论是还是我手机太小了。

Copilot 涨出一辆跑车

@搞仁义毛义仁 感叹 copilot 这个吊样居然被做起来了,股票一夜之间涨了一辆跑车——@稳重的海豚 认定必须是布加迪威龙。@搞仁义毛义仁 的解读:satya 要做地球上最大的中转站。

本文由作者按照 CC BY 4.0 进行授权