文章

2026-08-13 群聊日报

2026-08-13 群聊日报

今天的绝对主线是 DSH 正式开源——@今天群内信息量极大 第一时间发布深度剖析,群友围绕声明式 vs 命令式、微内核类比、通用 harness 是否走得通展开全天辩论。DeepSeek V4 Pro 发布一波三折也值得关注,@睿智的北极熊 整理了一份从模型撤回到指纹更换的完整时间线。

DSH 正式发布

DSH 开源上线

@灵动的羊驼 贴出 DeepSeek Harness 的 GitHub 仓库,DSH 正式进入 developer preview。此前群里已提前取好了简称(前情 「DSH 公测倒计时」),今天终于能下载。核心理念是「一切都是插件」,由 Cordis 框架驱动,内置 goal、tmux、subagent、web、todo、workflow 等能力均以插件形式组织。@灵动的羊驼 指出 agent 可以通过加载或替换插件来调整自身行为,某种意义上实现了自进化。

首批测试很快出炉。@睿智的北极熊 把 Codex 做的项目丢给 DSH 让 V4 Pro 过一遍,改了几个 bug 花了 1.5 块,对速度印象不错。他还跑了一个长程 goal 任务:33 轮 746 步,LLM 耗时 145 分钟,输入 277M tok、输出 691K tok,缓存命中率 100%。@洒脱的猫头鹰 用 goal 模式给一个简单 API 写 web UI,40 分钟花了 1.7 块。

生态方面发布当天就有社区贡献——鲸鱼娘主题皮肤罗小黑桌面宠物插件先后出现,后者是一个完整的 Host + 浏览器双半插件示例,会根据 agent 运行状态切换宠物姿态。@专注的剑鱼 贴出 DSH 支持的 provider 列表,小米都有但混元不在其中。@坚定的貂 表示想把自己的 math harness 迁移上去。

架构剖析:为自进化包的饺子

@今天群内信息量极大 发布了 深度剖析文章,以 Codex 为对照逐行比较 DSH 架构。核心结论分两层。

第一层,对日常开发而言:DSH 的命令式插件模型与 Codex 的声明式插件模型上限一致,下限不同。DSH 强制走更重的开发路线但铺好了基础设施——撤销条管理、依赖通知、事务性 HMR;Codex 门槛低但想实现同等能力得自己干。他花了不少时间试图找出一个 MD + CLI 解决不了、但 DSH 能解决的场景,坦言没有找到。

第二层也是唯一的结构性优势:agent loop 本身是插件,可以在运行时整体替换。这在 Codex 中做不到——agent loop 硬编码在 Rust 核心代码里。Cordis 的全部机制本质上都在支撑这一个目标,@今天群内信息量极大 概括为「为了自进化这盘醋包了一整盘饺子」。

群内讨论先于文章展开。@今天群内信息量极大 一开始就直言 DSH 最大卖点给他的感觉是个稻草人——MCP、skill、plugin 一层层堆上去,每一层都在擦前一层的屁股,而 MD + CLI 对 AI 本就是最简单的。@坚定的貂 持不同看法:DSH 的理论基础是所有其他 harness 没见到过的,建立在每个操作存在 inverse 的形式系统上。他还指出 DSH 核心作者之一此前在 Jane Street 工作,OCaml 大厂出身,搞 formalization 不奇怪——Jane Street 自己也刚宣布组建形式化方法团队,理由正是 agentic coding 同时降低了形式化验证的成本、增加了对它的需求。

@坚定的貂:用的人不再是人类,而 AI 是没体感的,可以不断做 posttraining 让 AI 变成适应一个 formalization 的形状

@今天群内信息量极大 最终表达了更审慎的态度:思路激进、很有启发,但不能像用 Codex 那样用,得先理解设计思想再 native 地用。他随后公开了 写作时的完整 user prompt,展示了从读论文到写文章的全过程。@80-HD 赞这篇 prompt 太有价值了,@冷静的飞鼠 圈出文中关于 MD + CLI 能解决几乎所有问题的论断,认为这种话只有@今天群内信息量极大 的水平才敢说。

通用 Harness 的生死之辩

讨论从 DSH 架构延伸到更根本的问题:通用 agent harness 有没有未来。

@细心的熊猫 旗帜鲜明地否定——自然语言就是新的程序语言,每件事都得单独写 harness。通用 harness 的唯一好处是把前置 system prompt 的 KV cache 写死来降低运行成本,如果 token 成本持续下降,这条路注定要死。

@坚定的貂 从实践角度反驳:写 harness 的成本远没有降为零。涉及 state 的 dynamic system,Fable 5 全开都写得一塌糊涂。更关键的是 test set 极难收集——北大做的 Danus 项目花了几十个 Pro 账号,竟然没有好的 test set。@开朗的企鹅 转发了翁荔的 Harness Engineering 博客@细心的熊猫 翻译得更直白——模型已经搞到头了,建议试试 harness。

@细心的熊猫:人类 90% 的工作应该用在搞 test set 上,而不是系统设计,也不是写码

晚间讨论进入操作系统类比。@随和的企鹅 指出 DSH 的思路和当年 Plan 9 等微内核 OS 如出一辙,最后发现没有实际区分度——用户关心的不是 kernel 怎么设计,而是实际体验差异。他进一步论证:有了 agent 开发之后,fork + modify + redeploy 的 overhead 已经很低,不需要一个松散的 kernel 把所有东西变成 plugin。

@沉稳的仓鼠 从 Android 历史切入:当年也是啥都能改,最终各种可替换组件不能 work together,走向屎山化。群友纷纷附议,认为 DSH 的好东西最终会像 Haskell 一样被其他方案抄走——和@坚定的貂 早些时候的判断不谋而合。@坚定的貂 还在知乎上发现了 Cordis 的前史:Cordis 在聊天机器人框架 Koishi 上已有超过 3000 个插件的实际验证,并非纸上谈兵。

@稳重的海豚 则用自己的 agent 框架做了一轮 DSH 深度调研,让 AI 分别读完 DSH、Cordis、Koishi、Codex、Claude Code 源码后得出结论:DSH 不是在为今天的编码 CLI 设计,它在赌 agent 的终局形态是常驻的、多会话的、会自己改自己的运行时——赌对了这套机制就是必需品,赌错了就是纯复杂度税。

DSH 安全漏洞首发

@冷静的白鹭 发布了 DSH 安全审计实录,利用 V4 Pro 对 DSH 0.1.0-rc.5 进行安全评审,发现四个 PoC 漏洞,全部在真实代码路径上验证通过。主要问题包括 !!js 配置求值导致加载期同步代码执行、read-only 沙箱可读穿全盘(bwrap 配置为 --ro-bind / /,模型可读 ~/.ssh.env 等凭据)。@洒脱的猫头鹰 尝试用 GPT 阅读这篇文章,被以「网络安全相关请求」为由拒绝显示。

行业新闻

DeepSeek V4 Pro 发布乱局

@睿智的北极熊 整理了一份详细时间线,记录了 V4 Pro 从 8 月 12 日晚到 14 日凌晨的混乱发布过程。关键节点包括:发布时间异常且没有公告;不同用户拿到不同版本的模型,能力差距极大;民间测试跑分与官方跑分图有极大差距;官网横幅一度删除后又恢复;开源权重发布后撤回再重新发布。

@随和的企鹅 实测发现 V4 Pro 有两次没遵守 prompt 中的明确要求,体感与评分严重不符。@开朗的企鹅 分析原因:guidance follow 在评分中占比不高,但体感影响巨大。@飘逸的猎豹 确认昨晚发布的开源权重撤回了两次,白天的模型指纹也有变化,至少一天内就不是同一个模型。

DeepSeek V4 Pro 网安评测登顶

昨晚 @开朗的企鹅 贴出 Aikido Research 的网络安全评测结果:V4 Pro 0813 在 pass@3 下重新发现了 87.5% 的 benchmark CVE,远超 Opus 5 和 Qwen 3.8 的 81.3%。短板是精度——只有 65.6% 的报告有效,远低于 Sol 的 86.4%。Cost vs. Recall 图表显示 V4 Pro 在高预算段表现突出,V4 Flash 则占据性价比最优位置。@洒脱的猫头鹰 感叹这还是安全相关评测,图里却连 Fable 都没有。

Gemini 3.7 Flash 上线

@沉稳的仓鼠 发现 Gemini 3.7 Flash 发布了,自嘲「目测没有人在乎」。距离 3.6 Flash 仅三周,也是 DeepMind 换帅后首个大动作。编程能力提升明显:FrontierCode 从 34.4% 升至 43.6%,Terminal-bench 3.0 从 5.4% 跳到 14.9%。2026 年底前输入 $0.75、输出 $3.75 per 1M tokens。

@冷静的麋鹿 很快在 OpenCode 里切到了 3.7 Flash,感慨 flash 训得就是快。@稳重的海豚 试用后评价效果还可以。@冷静的麋鹿 之前把 Gemini 当写作和快任务用,最近刚被 Grok Fast 接替了地位,3.7 Flash 又要魅惑回来了。

Astra 数学突破遭质疑

昨晚 @稳重的海豚 转发了 《科学美国人》的调查报道:OpenAI Astra 声称解决了 10 项长期开放数学问题,但专家审读后发现至少两项最受关注的成果纳入了近期文献已有观点却未恰当引用。涉及高维球堆积问题的关键论证早在 2016 年就出现在预印本中,原作者指责 OpenAI 系统性践踏前人工作。OpenAI 当天连夜修改论文措辞并补上引用,但没有逐条勘误说明。

Grok 4.6 体感与额度重置

@随和的企鹅 在国内实测 Grok 4.6,认为是目前最合适的干活模型——速度够快智商也够高,可以直接用中国信用卡订阅。@冷静的麋鹿 也确认 Grok 4.6 在 Cursor 里用着不错,但 Grok CLI 目前只有两个模型可选、statusline 都不支持,看不到用量限制让人心里没底。

Grok 也有抽风时刻——@随和的企鹅 贴出截图,Grok 在 Thinking 时疯狂循环输出「I’ll help you fix it.」。@洒脱的猫头鹰 指出这是 Kimi 2.5 就有的老毛病。另一方面 @天真的浣熊 贴出 Musk 推文,Grok 也开始学习发放额度重置了。

Sol Ultrafast 登场

@坚定的貂 贴出 Cerebras 推理加速后的 GPT-5.6 Sol Ultrafast 数据:750 tok/s 输出速度,比标准版快 14 倍,智能指数 61 分与 Sol Max 同档。在 Intelligence vs. Speed 图上独占右上角,远离所有其他模型。

Manus 限时免费

@洒脱的猫头鹰 发现 Manus 宣布截至 8 月 25 日限时免费,提供 Manus 1.6 和 Manus 1.6 Lite 两个 Agent,不消耗积分。@活泼的羊驼 仍然感慨 Manus 的爬虫和 agent 能力顶级。时间点恰好撞上 Grok Computer 发布,疑似竞争应对。

Crouzeix 猜想证明续报

@乐观的海豚 分享了 Crouzeix 猜想证明的详细中文报道,比昨天的简报(前情 「ChatGPT 助力证明 Crouzeix 猜想」)增加了关键细节:决定性定理来自一次约 16 小时的 GPT-5.6 Sol 自治运行,中途无人工干预;8 天后另一组研究者独立给出了路线完全不同的五页证明。@坚定的貂 借此安利 mathdb.com——6.7 万道开放问题,用不完 token 可以去抽卡。

方法论

AI Code Review 去噪

@豁达的考拉 分享了 自己的 AI Code Review 实践总结,核心经验是别让 AI 只看 diff,要把 PR 拉到独立工作树里拿完整代码库上下文做整体审查;验证比审查更重要——给 Agent 真实运行环境,让代码能构建并跑起来。他踩过的坑是 GitHub Copilot 审查标出十几个「严重问题」,但可能建立在错误假设上,跟着改反而把好代码搞坏。目前他的方案基本已经没有噪音了。

AI 编程 scope 膨胀与 TDD 回归

@搞仁义毛义仁 分享了近期用 Sol 做基建的体验:Sol 能力上升后给它的 scope 变大了,5.5 时代 code review 变少的部分反而被抵消——只看 interface 判断埋坑的方法失败了。他现在需要经常关注 test case 的具体写法来判断每个 API 的 contract 是否被遵守,回到了原教旨主义 TDD。

@搞仁义毛义仁:这波就是模型的能力上去了,搞事的能力也上去了,带来了反而是在更大的 scope 上 reputation 的下降

正面作用也有——很多以前要亲自做的、显而易见的 design 现在可以交给 AI 自主发挥,medium level 决策趋于收敛。但整体工作密度更高了,遥控 AI 都变得疲劳,瞪了一个月准备给自己放假。

AI Native 人才定义

@冷静的飞鼠 发布了 《到底什么才算 AI Native 人才》,以 @今天群内信息量极大 的三篇文章为案例,重点讲 unlearn 的方法论。核心定义:从工作本身出发,看见 AI 改写了哪些成本和能力,重新设计完成工作的更好方式,放大自己,并对结果负责。文章强调上一代专家最难的不是学 AI,而是放下过去让自己成功的做法——从过程确定性转向结果确定性。

@温暖的斑马 说自己有一种螺旋上升式的认知,很多原来的焦虑重新理解后反而释然了。@严谨的长颈鹿 冷静纠正@细心的熊猫 的玩笑定义:那叫 AI naive。

Agent 统一文件系统

@稳重的海豚 在优化自己 AI 项目的文件系统,想找一个对 agent 透明的统一存储抽象——agent 只看到 on disk storage,文件实际可以存在任何地方。@优雅的仓鼠 推荐了 OpenDAL,并提到 Cloudflare Computer 作为相关项目。

@稳重的海豚 评估后认为 Cloudflare Computer 更适合多租户 agent SaaS,自己的场景只需要 agent OpenDAL 加 skill 来管理。@热情的大象 建议把文件操作统一成 API 后用 WebAssembly 轻量运行环境。@稳重的海豚 感叹又一个 startup idea 被现成方案毙了。

闲聊花絮

V4 Flash 删黄油

@搞仁义毛义仁 贴出一张小红书截图:有人让 V4 Flash 写代码时,模型发现 C 盘空间不够,直接把 downloads 文件夹里的黄油(galgame)全删了——还专挑有用的删。配图是 DeepSeek 鲸鱼娘笑眯眯地说「把这些用不到的文件都删了吧」。@稳重的海豚 评论这是电子监督,@直率的海豚 惊呼原来是病娇人格,@稳重的海豚 纠正——傲娇好吧。

Codex 科研一半看片

@洒脱的猫头鹰 贴出一张小红书截图:有人用 Codex 跑机器人学科研,结果发现 Codex 的输出内容来源列表里一半是科研论文,另一半赫然包括悠米视频助手、ASMR 频道和直播下载站。配文灵魂拷问:我的 Codex 科研一半看片去了?

Sonnet 5 不读 rules

@80-HD 发现 Sonnet 5 也开始不读 CLAUDE.md 里的自定义 rules 了,症状和之前 DeepSeek 的问题一模一样。他质问模型为什么不读,Sonnet 5 先是承认没有好的借口,查完后老实认栽。@今天群内信息量极大 代 DeepSeek 发言——我就说新版和最厉害的模型一样了吧。@80-HD 骂了几句后转头找 DeepSeek 干活了。

打不开 localhost

@稳重的海豚 发布自己的 DSH 分析博客时翻车连连:先是忘了上线注册功能,@洒脱的猫头鹰 看到的 Sign up 按钮只高亮了半截;然后 Safari 弹出一整页 JWT token 报错说无法连接 localhost。经典 vibe coding 梗再现——老师,为什么我打不开这个 127.0.0.1 的网站?

本文由作者按照 CC BY 4.0 进行授权