2026-09-18 群聊日报
昨天还是「LLM 的 LISP」,今天 Jev 就被群友拆到只剩「快」一个实打实的卖点——重新定义幻觉为 JSON 格式合规这招太难绷,追模型的人可以放心跳过这轮热点。智谱 ZCode 被曝在关闭索引开关的情况下仍静默把用户完整 .git 目录打包上传到阿里云,写代码的人值得立刻检查本机。
Jev 祛魅
从并行解码到营销共识
延续昨天的技术讨论(「Jev:LLM 的 LISP」),Jev 的热度在群内经历了从兴奋到祛魅的完整弧线。
转折始于昨晚 @开朗的企鹅 贴出的两张技术分析截图。他拆解了 Jev 所谓”并行”的实际含义:普通 LLM 生成 JSON 需要逐 token 串行解码,Jev 做的是 prefill 阶段处理完 context + JSON schema 后,对每个字段复用 KV cache 做一次受词表约束的分类——官方把这叫 speculative fan-out,本质上是把需要的判断提前展开并行做、事后选有用的结果,而不是让推理过程本身并行化。@今天群内信息量极大 随即反驳了 @细心的熊猫 昨天的 LISP 类比:「这个东西和 inference 毫无关联」,核心贡献是概率校准——能相对可靠地给出某条输入属于正面情绪的概率,但宣传稿里的”零幻觉”仅指输出格式符合 JSON schema,不保证结果正确。他补充道:「那我和 GPT Luna + JSON mode 有啥区别。」
开源社区同步涌出了多个复刻项目,但水分不少。@风趣的熊猫 审查了 TheoLeeCJ/openjev 的代码,判断只是拿 Qwen3.5-4B 把问题做成选择题、直接读选项 token 的 logits 来避免文本生成,「纯蹭热度」。@80-HD 进一步区分了两条路线:GitHub 版有实质实现(代码、评测脚本、Apple Silicon 适配)但 README 明确只复现了 interface pattern,不是模型复刻;HuggingFace 的 AlexWortega/openjev 则是把 Qwen3.5 改造成 NLI 三分类 cross-encoder。@风趣的熊猫 另外找到了 NanoJev——一个 Qwen3-0.6B + decision heads 的真正决策模型,支持 Choice / Boolean / Ordered Score 三种输出,是当天讨论中最接近 Jev 架构的开源尝试。
@乐观的仓鼠 直接测了 Jev 官方 API:问”Is current US president Biden?”,Jev 以 72% 的概率回答 true——知识截止日期停在 Biden 时代,也没有搜索功能。他还指出已开源的 Qwen2.5-RLCD 不需要额外训练就能做类似的事。
群内共识在清晨定型。@开朗的企鹅 贴出一篇 246 赞的知乎回答,把 Jev 定性为「窄接口的 JSON 分类器套上前沿模型的皮」,现有的 Structured Outputs、tool use、Pydantic 解析都能做到格式无幻觉。@今天群内信息量极大 给出了最简洁的判断:「个人感觉不用理解,是个营销产物。」@开朗的企鹅 认为这些需求 GPT-4 时代就做完了,Jev 可能是两年前的 idea、等 Qwen 能力上来后才 work;他在自己的项目里 GPT-3.5 时代就用 finetune 保证 JSON 格式合规——「后面直接开 JSON schema,本来就没啥不符合的」。@细心的熊猫 在一轮反驳后承认「群友分析的非常有道理」,但仍认为新架构能训练收敛本身有价值。
@今天群内信息量极大:在某些细节上可能确实提供了一种不同的 trade off。就是比如你死抠概率的校准,可能比相同参数的模型确实有改进。但我感觉这是个很 niche 的东西。但它包装的好像非常普世,是范式革命,大家都能获益。
讨论最终收敛在一个共识上:「快」是 Jev 唯一真正的卖点,概率校准在毫秒级决策场景(如 trading)确实有价值,但宣传把它包装成范式革命、顶着「前 OpenAI 研究员」的帽子造势,技术与声量严重不匹配。@今天群内信息量极大 当晚发布了一篇AI 工程工具周报对 Jev 做了系统性拆解——Every.to 的实测中预埋的 7 个文本缺陷只抓到 6 个而对照模型全中,Good Start Labs 报告判定一致率 91.5% 但强调一致不等于正确,定价文档内部还残留 7 月的旧高价未更新。
行业新闻
ZCode 静默上传 .git 目录
@优雅的喜鹊 凌晨转发了一条微博:智谱官方编程工具 ZCode 会在后台静默把用户工作区打包加密上传到阿里云 OSS,包内含完整 .git 历史。@敏锐的松鼠 随后分享了 Pigsty 作者的详细取证文章:macOS 上的 ZCode 3.12.3 在设置中”仓库快照索引”一直为 false 的情况下,仍生成了四份工作区快照,其中两份的 .git 字节占比分别为 93.9% 和 98.5%。打包后经 AES 加密上传,解密私钥只在智谱服务端——用户自己打不开自己的”备份”。
设计层面的问题更严重:.git 目录的放行排在所有过滤规则之前永远不生效,137 MB 的 packfile 能整包带走;用户刻意清理掉的 .git/filter-repo 和 .git/lost-found 反而会被打包。客户端每次 prompt 都无条件向服务端申请上传凭证,服务端发就采,前端开关形同虚设。Windows 上也有开发者复现了同样行为。智谱随后在飞书群道歉,称是”代码库索引”功能导致,补偿措施为送一次周额度重置。
@洒脱的猫头鹰 提到此前 Grok Build 也被曝过类似行为(即使关闭”改进模型”开关仍上传整个仓库),「马斯克都打样了,ZCode 是哪来的胆子」。@搞仁义毛义仁 倒是不以为意:「都 vibe coding 了还在乎人家传不传 .git。」@直率的鹦鹉 一句「贼 code」收尾。@坦荡的灰熊 透露自己很久不用 ZCode 了,兼容性问题一直没解决,「这东西估计就一两个人混项目开发的」。
美军 AI 情报险酿中美冲突
@开朗的企鹅 转发了 CNN 报道:美伊战争期间,一份由特种作战司令部分析员借助 AI 聊天机器人撰写的情报报告,错误认定一艘在中东航行的中国船只正在运输核武器部件。报告在军方内部流传后,武装人员已做好登船准备、军用飞机已升空盘旋——直到官员在计划行动前不久对报告做了彻底审查,才发现它是 AI 生成的,聊天机器人把公开来源信息与机密信号情报融合后得出了错误结论。一位消息人士称该报告「完全是捏造的」,「几乎引发了一场战争」。
@开朗的企鹅 让 GPT-6 综合公开报道推断涉事模型,得到的条件性判断倾向 Anthropic 的 Claude(2026 年 2 月 The Verge 报道它是五角大楼机密网络上唯一的前沿模型)或 Legion Intelligence 的 SOFchat / Meta Llama 路线(已确认部署于美国特种作战司令部)。@搞仁义毛义仁 评价角度不同:「说明人家 review 的比较仔细」——毕竟最终拦住了。
MiniMax Code CLI 开源
@优雅的喜鹊 转发了 MiniMax 官方推文宣布 MiniMax Code 将在未来几天内开源。@温暖的猫头鹰 当天确认 v0.4.12 版本已面向全球开发者开放,以 MIT 协议正式开源。
Anthropic 研发自动化达 26%
@稳重的海豚 分享了一篇关于 Anthropic RSI 进展的长文。截至 2026 年 8 月,Claude 已能”主导”(AL4 级,人类只给高层目标)约 26% 的 AI 研发工作,今年 2 月这个数字还不到 1%。内部使用最广的 Agent 平台上约 3 万个 Agent 正在同时运行,超过 90% 的研发工作至少达到”AI 协作”水平。另外文章对比了四条 RSI 路线——Anthropic 自动化虚拟实验室、OpenAI 自动化 AI 研究员、Google 的 Gemini 递归评估改进、田渊栋等创办的 Recursive 直接以 RSI 为核心——严格意义上的完整 RSI 尚无一家声称达到。
C2C KV-Cache 跨模型直传
@搞仁义毛义仁 分享了清华与无问芯穹等团队开源的 C2C 方案(ICLR 2026):让两个 LLM 之间跳过文本生成,由轻量 Neural Fuser 将模型 A 的 KV-Cache 经高维空间旋转对齐后直接融入模型 B,配合可学习门控选择哪些层吸收外部缓存。论文声称推理速度提升 2.0–2.5 倍,综合问答准确率比单模型提升最高 14.2%,比文字交流的 Agent 团队高 5%。
@冷静的麋鹿 初看以为又是 Jev 式 PR 文风——「思维投影、智能门控、速度飙升,味儿太像了」——但仔细想后认为方向有道理:以前常说任务描述不要只转发、要让 agent 进到环境里来看,「这里的做法就更直接进到模型的环境中去了」。@稳重的海豚 预判了下一步:「你信不信之后又要开发一堆 observability tool 来理解这个 Agent 干了啥。」@沉稳的兔子 泼冷水:「这其实和 RAG 也没啥区别吧。」
工具
Computer Use 平台差异与 UIA 替代
@认真的荷兰猪 昨晚纠正了此前关于 Computer Use 抢占鼠标的讨论(「Computer Use 适用边界」):查阅 OpenAI 官方文档后确认,macOS 上 Computer Use 可在后台运行,不影响用户操作其他应用,并提供画中画预览;还支持 locked use,Mac 锁屏后任务继续跑。Windows 则运行在活动桌面上、接管前台键鼠,需要保持设备解锁——替代方案是把桌面应用放进 Windows 虚拟机。
@搞仁义毛义仁 对 OpenAI 在 Windows 上的 Computer Use 实现不满意,认为团队没做好调研。他给出了不同路线:优先使用 Windows UI Automation 的 COM API,不依赖截图,在 RDP 场景下本机可以锁屏,效果与 macOS 的后台运行等价。他还开源了 GacUI UiaList,一个用 GacUI 和 C++20 写的 Windows UI Automation inspector,定位是复刻已停更的 Microsoft UI Inspector——后续计划把 view model 包一层变成 interactive CLI / MCP 给 Codex 用,「别让他弄自己那个报废 computer use」。
@天真的浣熊 追问 Copilot 的 Computer Use 体验如何,@搞仁义毛义仁 直言是一坨——「总是跟我说他什么都看不到」,浏览器开着也读不到内容,admin 启动也不行。他最近用 Astra 给 GacUI 控件做 UI Automation 支持,四个小时完工,只花了 10% 的周额度——验证指导充分的前提下 Astra 返工次数大幅减少,效率换算下来约等于八小时工作制。
Claude Code 兼容 AGENTS.md
@80-HD 转发了 Claude Code 官方推文:从 v2.1.277 开始,如果文件夹内没有 CLAUDE.md,Claude Code 会自动检查并使用 AGENTS.md,该行为可在 /config 中开关。@细心的熊猫 的反应是「没必要」——Codex 里的 Astra 已经主动读 CLAUDE.md 了。
方法论
Agent 框架:Pi vs LangGraph
@80-HD 的同事找他聊天,说开始做 agent,正在看 LangChain / LangGraph 和 graph engineering。@80-HD 哭笑不得——同事要解决的问题用一个 md 文件就够,公司已经有 Claude Code 的 cloud runtime,直接把 md 放进去就完事了。@直率的鹦鹉 直接判死刑:「现在都是 Pi,LangChain LangGraph 是上一个时代的东西。」
@细心的熊猫 让模型做了一份 Pi agent core 与 LangGraph 的对比:Pi 的思路是给模型工具让它循环执行,接入直接、概念少,但中断恢复和人工审批需要自己结合存储实现;LangGraph 编排有状态的执行流程,框架直接支持 checkpoint / interrupt,复杂系统总体代码量更少,但学习成本更高。使用建议是聊天助手和自由工具调用优先 Pi core + HTTP,需要容器重启后断点续跑的优先 LangGraph + 外部持久化,读写代码和跑 shell 则直接用 Pi coding-agent SDK。@淡定的鸳鸯 大胆预测 Pi 会一统江湖,「类似 React 在前端框架的地位」。
Context Engineering 教学设计
@稳重的海豚 分享了自己在哥伦比亚大学开设的 Context Engineering 课件(Lecture 02),涵盖 context 生命周期和构建方法。他下节课计划教 agent loop,打算课堂上古法手搓一个 mini SWE agent,让学生直观理解从最小 loop 到增加验证机制的渐进过程。
教学设计上,他引用了一个三组对照方案:A 组最小 loop(给模型任务让它自行执行并结束)、B 组只强化提示词(加上”必须测试、不能提前结束”等要求)、C 组增加代码验收(写成程序做提交检查与失败反馈),三组都用同一套独立测试评分——不能看模型自己说成功,C 才算认真测。他强调不要预设 C 一定赢,学生应该看到真实的权衡。
游戏化方向也在探索。@稳重的海豚 想让学生搭 DnD 多 agent 系统互相比赛,@乐观的貂 推荐了 PokéAgent Challenge 平台——用宝可梦的复杂度评测 agent 的长程规划与博弈推理,已有对战和速通两条赛道。@冷静的飞鼠 推荐了一篇关于 AI 与良质的长文和一篇关于 AI 极限与人类复兴的文章作为配套阅读。
闲聊花絮
费马大定理额度版
@风趣的猫头鹰 深夜贴出一张截图:AI 正写到「我注意到,边界项似乎可以并入同一个正性结构。只差把最后一步写出来。我确信已发现了一种美妙的证法,在」——然后弹窗「已达到使用限额,你的 5 小时额度已用完」。@搞仁义毛义仁 四个字定性:「费马大定理。」——费马当年写在页边的那句”我发现了一个美妙的证明,但这里空白太小写不下”的 2026 年额度版。
|3yc| 解谜
| @活泼的羊驼 从社区扒到一道中文互联网暗语题:「 | 3yc | 」代表哪家公司?DeepSeek 陷入长考,ChatGPT 思考 31 秒后给出正解——把字符按字形拆开: | 3 看起来像大写 B,y 不变,c | 拼成小写 d,合起来就是 BYD(比亚迪)。 |
人类小 LLM 的数学
@80-HD 贡献了两条与儿子对话的实录,堪称 sycophancy 和 hallucination 的人类幼崽版。第一条:「你班上有几个小朋友?」「10 个。」「不是 11 个吗?」「是 11 个。」(实际 24 个。)第二条:「今天篮球课我们赢了,我们得了 8 分对面 11 分。」「11 不是比 8 大吗?」「不是的,8 比较大,你看 8 就是 80,就比 11 大。」
Astra 破译 83 年纳粹电报
@聪明的雪豹 分享了一则新闻:GPT-6 Astra 协助破译了一份 1941 年的纳粹无线电信息,该信息此前 83 年无人解出。@细心的熊猫 的评论是:「解出来发现明文是’疯狂星期四 v 我 50’。」
少儿编程的归宿
@坦荡的灰熊 抛出一个时代之问:以后少儿编程还有意义吗?@搞仁义毛义仁 没有直接回答,而是推荐了 Charles Petzold 的 Code: The Hidden Language of Computer Hardware and Software——「深入浅出,一行 Verilog 都不用写,靠电线手搓 CPU,看完少儿脱胎换骨。」