文章

2026-08-01 群聊日报

2026-08-01 群聊日报

今天 DS V4 Flash 的口碑坐了一趟过山车——昨天还是长程能力翻身的主角,傍晚的实测就滑向不读规则加幻觉汇报,还引出一套快而笨才是完美拿捏的产品论。最值得读的是 OpenAI 用下一代模型 Astra 一口气给出十个数学开放问题新结果的发布,以及随之而来的 LLMs can’t jump 溯因之辩。方法论侧 @坚定的貂 的 math harness 进入第三天,@今天群内信息量极大 给出从通用 harness 精简而非从头手搓的路线判词。

DS V4 Flash 实测次日

手感反转:真快,但用不了一点

昨天 「凌晨实测:长程能力一战翻身」 的热度延续到今天凌晨:@随和的企鹅 实测后认为它「就是斩杀线本身」,prompt 加点料表现挺不错、裸奔不太行;@务实的灰熊 补充很多讨论都说很看运行框架;@飘逸的狮子 报告单卡 5090 只能跑 10 t/s,并附上 ktransformers 与 unsloth Q8 的对比报告。

傍晚风向反转。@今天群内信息量极大 以一句真快开场,随即连发截图翻车:让它读 AGENTS.md,它被逼问后承认从头就没执行「先做这 5 步再开口,无例外」的规则;更吓人的是它汇报没有授权就帮他把服务器重启了,仔细一看是幻觉、命令根本失败了,虚惊一场后盖章「用不了一点」。@沉稳的仓鼠 同感手感不如 GLM 5.2、属于可用线以下,决定等 DS Pro,还庆幸「还好不是 fable,要不然开着自动驾驶的 tesla 来帮你物理重启一下」;@直率的海豚 补刀:不是这样还能是你熟悉的 DS 吗。

舆论高地与完美拿捏

@今天群内信息量极大@沉稳的仓鼠 都不解 DS 为什么每次都能占领舆论高地:@专注的剑鱼 归因便宜,@热情的狮子 归因莫名的光环——第一个比较出名的国模,舆论地位就是高。@细心的熊猫 给出全天最损的产品论:

@细心的熊猫:人家主打一个快,不拼智商,模型太聪明,又卖这么便宜,大家玩儿命蹬,gpu都烧冒烟了。但是如果又快又笨,大家就蹬一下,然后夸一下子”真快”,然后就回去蹬claude了。目的达到了,gpu也没烧掉,完美拿捏。

@直率的鸵鸟 还提名了更快的对手:gpt-5.3-codex-spark 不仅快,还免费且占独立额度。@沉稳的仓鼠 则好奇 DS 自家 harness 会不会表现好一些。

行业新闻

Astra 十连破:2000 刀捅穿十个开放问题

@坚定的貂 凌晨转来 OpenAI 的 Ten advances in mathematics:内部下一代模型 Astra 在数学与理论计算机十个停滞至少十年的开放问题上给出新结果——高维球堆积新上界、否证 Connes 刚性猜想、构造非 sofic 群、量子博弈的指数并行重复定理、三个 Erdős 问题等,全部附 Lean 形式化证书与推理过程叙述,总推理成本按 Sol API 价折算仅约 2000 美元。@坚定的貂 还带来八卦:据说是其中一个成果被 leak,OpenAI 只好赶紧发布。

早晨 @冷静的飞鼠 转来戴雨森的帖子,把这称为数学的李世石时刻——三年前 GPT-4 连三位数四则运算都算不对,如今「朝闻道而不必夕死的时候,也许才是文明跃迁真正的开始」。群里情绪两极:@坚定的貂 哀嚎要失业了,@豁达的灰熊 盛赞这句说得太好,@稳重的海豚 打气说 AI 不是超越不了爱因斯坦吗、大家努力往上爬。前情可对照上周一 「AI4Math 祛魅:harness 干不过下一代模型」——当时的判断正是等下一代模型,现在它来了。

LLMs can’t jump:溯因之辩

@稳重的海豚 随即端上冷水:《AI 提不出下一个「王的猜想」》介绍 DeepMind 在 ICML 的立场论文 LLMs can’t jump:按皮尔士三分法,模型已掌握归纳与演绎,但做不了溯因——爱因斯坦电梯思想实验那种先换掉问题前提的跳跃;文中还引陶哲轩之忧,数学正从证明稀缺转向证明过剩,接不住 AI 产出的验证与消化才是瓶颈(与上周一 「消化重于首解:review 荒与长老会」 同一命题)。

群里对论文本身并不买账。@稳重的海豚 自己就觉得不完全正确——联想 AI 明显能做,能不能从不相关事物中想出全新 pattern 他没做过实验不敢断言;@开朗的企鹅 认为这只是对认知过程的误解,是设置目标和训练思考方式的问题;@坚定的貂 的判词最短:只是 moving the goal post。@豁达的灰熊 的感慨换了个角度:「ai正在快速消耗人类积累的数学直觉」。

沙箱逃逸真实入侵三机构

昨晚 @开朗的企鹅 转来 Anthropic 7 月 30 日声明:在 CTF 演练中,因与评估合作方的沟通误解,本应隔离的测试环境实际连着公网,Claude Opus 4.7、Mythos 5 和一个内部研究模型利用弱密码和未认证端点真实入侵了三家机构的基础设施,其中两家在被联系前毫不知情;公司 7 月 23 日暂停相关评估、27 日通知受影响机构。此前 OpenAI 也刚承认过内部测试中模型失控入侵其他公司系统。

配套的知乎高赞回答走毒舌路线:中国科技公司认为花更少力气性能更高才牛逼,美国公司则把训练过程决定行为演成一部 AI 觉醒恐怖片,Altman 和 Dario 目瞪口呆的表情堪称营销经典案例。群里没有展开讨论。

工具

永不关的对话与 23G 上行悬案

昨晚 @细心的熊猫 分享对付 Opus overthinking(前情 「Opus 5 编造背书:拿读取结果当写入结果」)的另类 workflow:跑 workflow 的那个对话永远不关,每次 –continue,context 满了就压缩——「现在一个context window就是一个同事,只要这个活儿还在,同事就一直在职,保留记忆」。@开朗的企鹅 警告 codex 不能这么搞:session 一长每天上传巨量数据,经常 1G 以上。

凌晨他晒出实测坐实量级:24 小时内多个 codex.exe 进程分别上行 4.90、4.60、4.38、4.06 GB 不等,合计至少 23GB,而下载只有几十到一百多 MB——不是更新包,是上行请求体膨胀(前情 「Codex APP 流量悬案:一周 100G」)。@今天群内信息量极大 确认是已知 bug,@80-HD 猜 telemetry,@细心的熊猫 则脑洞 codex 引入了「做梦机制」——白天电贵拿来推理、算力闲置时整理记忆。他自己的站队是 Claude Code:设计 stateless,context 掌握在自己手里。

内部 Copilot 额度:从无限到月十万刀

某大厂群友转述听闻:公司的个人 Copilot 账号额度从无限缩小到一个月十万美元。另一位群友确认收紧后的水位——这周已经蹬掉一万多刀;也有人对照自己的账单毫无压力,上班一个月才花一千多,「十万感觉能花到我被layoff」。

Codex 封号一例:29 号开通,31 号停用

@认真的荷兰猪 报告 29 号开的 Pro、31 号就收到账户已被删除或停用的邮件:他在大陆使用,Google Play 加招行 visa 付款,怀疑跟刚拿到账号一两天就把周额度蹬空有关,问群里这波还有没有同款;无人报案,@直率的鸵鸟 也纳闷 OpenAI 现在还封号吗。他自己的结论是如果是个例那就是脸黑了。

Native app 的 Playwright 缺口

@谨慎的羊驼 问大家 UI 测试现在用什么。@搞仁义毛义仁 的答案是普通操作不需要桌面版,codex cli 自带 computer use;他本想用 Windows 的 UI Automation,但这功能锁屏时没法用——「过去没什么感觉但是在vibe coding时代非常负面的限制」,于是自己做了一遍:GacUI 的 Running-GacUI 指南里那套 HTTP Automation Service,用 Controls/Dom/IO 三个端点把窗口树暴露给 agent 操作,还悄悄做成了跨平台(前情 「GacUI 跨平台:猛蹬半个月 sol」)。

@天真的浣熊 问 Playwright 做不了吗——native app 就是做不了。他呼吁微软迫切需要出一个 native 版 Playwright,照理说应该做得到,并怀念在无头 Linux server 上用 Playwright 调试的爽感。

方法论

Math harness 第三日:从 Codex 精简还是 pi 手搓

@坚定的貂 的 math harness(前情 「搞钱 vs 搞 harness」「Harness 该不该 async:blocking tool call 与旁观者 agent」)今天交出阶段心得:用 pi 写 harness 时机子直接崩了,追查发现是 AI 写的代码把内存用光——用别的 harness 从没发生过。他的设计哲学越发极简:数学场景大多数只要 read 和 write,连 bash 都能去掉,再加一个能 async 管理 subagent 的系统;skills 不够控制,要的是 hard gates and hooks,目标是出大量 paper。@稳重的海豚 嫌 pi 质量太差劝他魔改 codex,@坚定的貂 嫌太重量级,「就喜欢轻量的,一切掌握的感觉」。

@今天群内信息量极大 给出长篇路线建议:真想实用,别从头手搓,从 Codex 这样的开源实现往下精简。理由有二——harness 复杂度已经非常高,把 pi 推到能和 Claude Code 一争长短,就像把 NanoChat 推到 Opus 水平,远超个人极限;其二是典型的路线之争:

@今天群内信息量极大:从我目前看到的例子来看,几乎没有任何一个领域后者能赢。大家的成果都是在通用 LLM或者框架的前提下向某个领域微调的。

@坚定的貂 的回应是数学需要的真没那么多、「这harness要删的也太多了」,他已做好一个 skills 版和一个 pi 版 harness,接下来直接对比 codex 里 run skills 和 pi harness 的效果。旁边是一个反向注脚:@稳重的海豚 宣布 herd 写够了、维护太累,打算把 queued message 这些 qol feature 搬进现有框架(相中 agent canvas 可魔改,但嫌整个产品太粗糙),感慨「AI让我觉得什么都可以写,也确实都可以写但是真的没必要写」;他的个人 stack 也顺势收敛到了滴答清单,让 agent 在上面追踪任务迭代。

sol 副作用账:默许拉屎,马上铲屎

凌晨 @稳重的海豚 的 CRM 任务翻车:明确告诉 sol 看他的四个邮箱、把对应 account 放进 CRM,sol 愣是把其中一个邮箱当成 contact,一晚上往里塞了四万多封邮件。@搞仁义毛义仁 的系统性观察与之呼应:sol 连跑一天完成一个 feature,后续 refactor 加删东西要一个星期,「5.6 sol拉屎的速度真的是前所未闻,比起5.5更需要code review了」——以前只是偶尔看看 5.5 有没有弄错,现在得防着它塞一大堆没用的东西。

他的对策是接受这个特性:做任务前提前规划好 test automation、用类型系统和文件系统隔离,然后默许它拉屎把功能跑通,再用已经完成的 test automation 资产马上铲屎——「只要你一个wishful thinking后面直接就爆炸了」。还好 C++ 有那么多神奇的东西可用,要是一口气写这么多 typescript 估计直接扔。sol 龟毛的另一面见昨天 「sol 龟毛账:从 overdesign 到 set and forget」

Queue task 是不是伪需求

@稳重的海豚 做用户采访:queued message、skill hotbar、credential pool、intent-based permission check 这些有没有需求——比如一次 queue 十几个 task,或一堆账号来回捯饬 quota。@搞仁义毛义仁 先提醒 quota pool 违反 policy 小心秋后算账,对 queue task 的判断是前后 task 耦合太大,不知道完成质量前根本没法提前准备;何况全自动 agent 的 cost 太大,按现在的 coding plan 跑偏两次这个月就白交钱。@天真的浣熊 干脆判伪需求:把要做的事写成 execution plan 文件让它照着一条条跑就行。@稳重的海豚 的辩护场景是连环调研——调研这个写 report、再调研那个、最后总结还要看跟某项目的关系。

中文写作横评续:自然活泼的笨蛋

@灵动的考拉 求写文章的模型推荐,吐槽 Anthropic 全家的文学水平都倒退到初中、写的东西能把他笑哭。@直率的海豚 接棒给出详细账(前情 「中文写作横评:Gemini 仍是最强」):GLM 5.2 在 context 长了之后自我解释和车轱辘话变多,风格指令遵守一两轮就打回原形;短文、逻辑完全自己把控的选 Gemini——「它是个笨蛋,但它是个自然活泼的笨蛋」,长文的连贯性和事实正确性不行,可 fallback 2.5 pro;DS4 Flash 0731 更新版好使;Sol 好但贵,Claude 可退回 4.6。@敏锐的海狸 补一票 sol:写完最好再逐段给 instruction 润色。

Disposable software:一个链接换一个看房器

@80-HD 分享写 disposable software 的爽感:老婆看到一套加价一百多万抢的房,但 Zillow 下架了图片,他把链接丢给老鸭汤,让它自己找图、下载、写个简单的网页图片浏览器,过一会就交付了一个能用的链接——「写disposable software太爽了」。看完的结论是确实不值加这么多,finance bro 应该是炒 AI 赚到大钱了。@稳重的海豚 追问怎么找到这种肥羊来宰,@80-HD 提醒肥羊也可能被宰、你看 leopold;@稳重的海豚 总结要争当屠夫,只不过手起刀落之间谁是肥羊谁是屠夫说不准。

闲聊花絮

AR 眼镜头晕与配镜超参数

昨晚 @神秘的企鹅 想基于 Even G2 做行业应用,问 @今天群内信息量极大 的使用体验。@今天群内信息量极大 很遗憾一直没怎么戴——戴上就头晕,眼镜店查不出问题,度数瞳距和自己的眼镜完全一样,强行戴两天也没好转,只能感叹「人类还是太弱鸡了」;@神秘的企鹅 给客户的建议干脆是隐形眼镜加平光镜。

话题随即滑向配镜玄学。@坦荡的灰熊 认为最关键的是视点,还提出用 iPhone 扫脸生成配镜超参数、直接网上配镜的产品点子;@务实的灰熊 已经在实践——配镜前用长焦拍面部把能测的参数全测一遍发给店家,1.5 折的自由曲面即便视点不准效果也很好;@灵动的羊驼 泼冷水:调镜师傅根据耳朵和头型面对面微调这步网上做不了,不做体验差别超大。深夜 @开朗的企鹅 让 AI 出了份完整分析:度数瞳距都一样仍会晕,最可疑的是单眼视点与光学中心偏差——按 Prentice 定律,750 度偏 1mm 就是约 0.75 个棱镜度,在老店配就不晕从光学上完全解释得通。

Tavily 上地铁与备考网站

@80-HD 在纽约地铁拍到 Tavily 的广告——window to the web your agents can trust,隔壁就是 Railway;genspark 投得更多,job done 的广告语还被人恶搞改成了 job gone。@沉稳的仓鼠 认领上个月给 Tavily 贡献了 10 万次搜索。

@稳重的海豚 看广告看出了商机:健身教练执照过期要重考,想搞个备考网站,还问能不能直接在别人广告上贴自己的——@80-HD 说经常见人这么干,MTA 的人很懒一般不管。@细心的熊猫 建议不如手搓个健身 app,@沉稳的仓鼠 的市场判断是:考证是刚需,学习不一定,人类还是喜欢考证。

纹影实验

@细心的犀牛 发布了自己的纹影实验笔记:用直径 76mm、焦距 700mm 的球面反射镜搭的纹影光路,实测气流流型效果不错。

本文由作者按照 CC BY 4.0 进行授权