HN Daily Reading · 每日阅读

HN 每日深度阅读 · 2026-07-29

本期以技术议题为主轴:Kimi Linear、Kimi K3、DeltaNet 推导与 500 美元 RL 微调共同勾勒出线性注意力与小模型特化的进展,Anthropic 用 Claude 发现密码学缺陷、OpenAI 开源 Codex Security。

2026.07.29 20 篇摘录

共 20 篇 · 约 12,289 字 · 约 31 分钟读完

1. 日本九州发生 7.1 级地震,震中位于熊本县

日本气象厅(JMA)发布地震详情页面显示,熊本县熊本地区发生一次震源深度约 10 公里、震级 M7.1 的地震。震中位于北纬 32.6 度、东经 130.7 度附近。熊本县宇城市和冰川町记录到日本震度阶最高等级 7,熊本市南区、八代市、宇土市、美里町、益城町等多地录得震度 6 强,长崎、鹿儿岛、福冈、佐贺、宫崎、大分、山口、爱媛等多个县亦观测到 4 级以上震动,影响范围覆盖九州大部及部分四国、中国地区。

HN 讨论中,多位在日用户实时汇总 NHK 报道:至少 50 人因不同伤情送医,9 人失联,12 处房屋倒塌,4 起被困及 7 起火灾;高速公路多处桥梁断裂,永旺(AEON)某商场在疏散后发生原因不明的爆炸,日本制纸工厂烟囱倒塌;台积电、索尼、富士胶片在当地的芯片、图像传感器和材料工厂已疏散。GPS 参考数据显示地面最大位移达到 84 厘米。熊本城石垣再次受损。因许多紧急避难所建筑安全性未确认,当局开放停车场供民众在车内过夜,同时警告注意”经济舱综合症”风险。

评论者指出,日本的震度(shindo)比震级更能反映实际破坏,震度 7 属极强烈。有用户提到震中位置与 2016 年熊本地震相近,而熊本从上次地震中的重建才刚接近尾声,年轻人口正持续外流至福冈。福冈(约 100 公里外)的用户表示明显有感。多人提到民间地震信息服务 NERV(外观借用同名动画)率先发布震中和震度信息。也有人担忧此次地震是否与长期被预警的南海海槽大地震存在关联,以及对韩国等邻国的影响。


2. La Jolla 新型 HIV 疫苗在灵长类实验中取得前所未有的免疫反应

La Jolla 免疫学研究所(LJI)、斯克里普斯研究所与 IAVI 合作开发的新型 HIV 疫苗在《Nature》发表结果,在恒河猴模型中首次以较高比例诱导出针对 HIV 的”广谱中和抗体”(bnAb),研究由 Shane Crotty 和 William Schief 领衔,历时 14 年。人体一期试验已经启动。

HIV 之所以难以攻克,是因为其表面覆盖着不断变化的糖分子外壳、突变极快、且在感染细胞时会改变结构,使 B 细胞难以形成有效抗体。研究团队采用”germline targeting(生殖系靶向)“策略:先分析极少数感染者体内自发产生 bnAb 的 B 细胞成熟路径,反推出各阶段所”看到”的 HIV 包膜抗原片段,再由 Schief 实验室通过分子工程设计出模拟这些抗原的疫苗分子,按顺序作为”启动针”和一系列”引导性加强针”注射,如同引导 B 细胞走完一段训练课程。结果约 44% 的实验动物在血液中产生了丰富的广谱中和抗体,其结构与人类罕见 bnAb 相似。实验尚未直接测试防感染效果。

HN 讨论中,最受关注的一点是这种”课程式”多针疫苗设计思路的新颖性——每一针对应 B 细胞成熟的不同阶段。也有评论提醒:HIV 疫苗历来”承诺多、成功少”,绝大多数候选疫苗都在一期试验中夭折;44% 的应答率距离理想的接近 100% 仍有差距。有从公共卫生角度的评论指出,PrEP(暴露前预防)等口服和长效注射方案已能有效阻断 HIV 传播,问题主要在于覆盖面和公共教育,而非缺少疫苗。也有人询问为何人体自身很少产生这类广谱抗体、疫苗与现有周期性方案的本质差异等技术问题,以及对同行评审文件和独立报道的引用。


3. 欧洲公民倡议:反对强制数字身份和年龄验证

一项名为”Stop Killing The Internet: No Digital ID & No Age Verification”的欧洲公民倡议(ECI)已由欧盟委员会登记,代表人为比利时的 Paul Diegel。倡议呼吁欧盟委员会立法,确保用于访问在线服务的数字身份和年龄验证系统在欧盟境内保持自愿、隐私保护和非歧视性;除非法律明确规定的严格必要、比例适当的情形,公民不应被强制身份识别才能访问合法在线内容或服务。

倡议列出的具体立法要求包括:基于隐私保护密码学的匿名或假名年龄证明;技术和法律上禁止跨服务追踪;默认数据最小化和选择性披露;强制采用开放标准和可公开审计的密码协议;独立的安全和基本权利审计;对定义技术规范的实施法案进行议会监督;以及为不使用数字钱包的公民保留等效的非数字替代方案。倡议援引《欧盟基本权利宪章》第 7 条和第 8 条,主张欧洲可以在不建立永久性在线身份层的前提下保护未成年人,数字身份必须保持自愿、去中心化,不应把公民锁定在单一的国家或大公司主导的钱包中。

HN 讨论主要围绕几条主线:一部分工程师警告不要低估此类系统的控制能力——在当今技术条件下,绕过会比 1990 年代困难得多,其本质风险在于对”谁能看到什么”的绝对管控。另一部分评论者支持某种形式的可验证身份,理由是完全匿名助长了当前互联网的毒性文化及 LLM 驱动的机器人操纵,尤其在选举周期中;他们主张的是”可选择性自证”,而非默认匿名。也有人以物理世界中酒吧、赌场的年龄检查作类比,认为线上年龄门槛并不天然不合理。技术派讨论隐私保护密码学能否真正实现”仅证明年龄不泄露身份”,同时担心难以外部验证平台是否履行承诺、以及被滥用于歧视性场景。还有评论者关注 ECI 机制本身:今年编号仅到 11,签名门槛为一百万,实际推动力有限。也有针对该倡议名称、签名页尚未开放等程序问题的讨论。


4. 作者需要自己的网站,而不只是 Substack

博主 Elizabeth Tai 撰文主张,Substack 只是内容分发工具,不应成为作者的”数字家园”。她观察到近年越来越多写作者关闭个人网站,把 Substack 当作主站,甚至在个人网站上把 Substack 链接称作自己的”博客”。她认为,如果使用的是 xx.substack.com 形式的地址,等于把全部内容主权交给平台;即便绑定了自有域名,Substack 作为 CMS 在 SEO 和自定义方面依然受限,规则也可能随时改变。

文章回顾了 Facebook、Tumblr、Medium 到 Substack 每一波”数字天堂”承诺的破灭,认为在别人平台上建立受众的写作者本质上是”数字佃农”。她推荐 IndieWeb 社区的 POSSE(Publish on Own Site, Syndicate Elsewhere)方式:以自有域名网站作为唯一权威源,再把内容同步分发到各平台。她还提到,平台算法倾向于美国主流叙事,对本地化或少数群体声音不友好,作者被迫迎合算法偏见,并以坚持不离开个人网站的 John Scalzi 为正面例子。

HN 讨论呈现明显分歧。支持者中,Simon Willison 分享了自己的做法:先发布到个人博客,再每周复制粘贴到 Substack 邮件通讯,用其低成本触达 6.6 万订阅者,同时保留自有站点作为原始出处;他还提到 Substack 虽无组稿 API,但富文本编辑器接受粘贴,可视为”通用 API”。另有基于 AT Protocol 的开放发布应用 Leaflet 及 Standard.site 互操作规范作者介绍其”发布数据归属用户”的方案。反方观点同样强烈:一位老牌网络作者直言”没人会主动访问你的网站”,缺乏推送机制的个人站难以触达读者,RSS 太小众、社交媒体算法奖励政治化内容,Substack 的价值在于无中介地把内容推给订阅者,只要允许导出订阅者邮件列表就不算陷阱。也有作者表示 Substack 的网络效应对多数普通作者并不显著,被推荐的多是头部内容,因而宁愿在自有站点接受低流量。还有人由于担心 AI 抓取而干脆关闭个人站,或质疑 Indie Web 缺乏中立的支付层。文章亦被链接到经典博文《Don’t Build Your Castle in Other People’s Kingdoms》。


5. 如何在沸水中存活:芽孢菌与益生菌茶的家庭实验

文章以 MIT Random Hall 宿舍那罐 1994 年买来、被”庆祝生日”长达 27 年的未冷藏牛奶为引子,回顾了巴斯德通过”鹅颈瓶实验”证明发酵由微生物引起、并发明巴氏杀菌法的历史,进而引出现代社会对杀菌的高度依赖:抗生素处方、消毒产品、Steris 这类灭菌设备巨头以及每年约 500 亿升牛奶的巴氏杀菌规模。

在这一背景下,作者把焦点转向益生菌产业中被宣称”能耐受高温冲泡”的芽孢菌 Bacillus coagulans GBI-30 6086(BC30),它被添加到号称”含活益生菌”的茶饮中。作者以一系列家庭+实验室对照实验测量了 BC30 在冲泡后的存活数量:热泡茶、冷萃茶等条件下均能检测到活菌,但存活数量比包装宣称的”治疗剂量”低约三个数量级。她还讨论了实验设计的困难:芽孢菌以孢子形态度过高温,然后在肠道条件下才萌发,因此还需要经过胃酸、消化酶以及与既有肠道菌群共存的考验,家庭冲泡数据难以直接对应人体效果。

HN 讨论有几条主线。有读者仔细核对 CDC 数据源,指出文中”7/10 美国人 2024 年被开抗生素”的表述实际来自”每千人处方剂量”,同一人可能被多次开药,因此比例应更低。多条评论补充芽孢菌的极端耐受性,包括耐辐射球菌等;一位前生物工艺工程师分享了蜡样芽孢杆菌在原位培养基灭菌(>121.1°C、30 分钟)后仍存活的排查经历,强调”永远不要低估微生物”。也有评论指出灭菌通常需要高压灭菌器(autoclave)而非单纯煮沸。医学侧的讨论涉及副结核分枝杆菌(Mycobacterium avium subsp. paratuberculosis)可存活于巴氏杀菌牛奶中,且长期被怀疑与克罗恩病有关。另有推荐阿姆斯特丹 Micropia 微生物博物馆和 Random Hall 牛奶后续(据 MIT 招生博客,该牛奶已于 2022 年”失踪”)。评论者也普遍称赞了作者的叙事风格,以及”顺手下载 BC30 基因组”这类细节体现的低成本生物技术能力。


6. 500 美元强化学习微调 9B 开源模型,在商品目录审核上击败前沿模型

Fermisense 撰文介绍了一项以电商商品目录审核(catalog integrity)为任务的实验:使用 GRPO 强化学习对一个 9B 参数的开源模型进行微调,训练总成本约 500 美元,最终在同一评分器、同一工具与图像输入条件下,其质量达到最大可达分数的 87.3%,而五个前沿模型经过 prompt 优化后成绩均集中在 76.9% 左右(相对提升约 13.5%,相对未微调的基础模型提升 36%)。成本方面,特化模型每千条列表约 0.5 美元,比最便宜的前沿配置低约 40 倍、比最贵的低约 340 倍;按每天约 4000 万决策规模,成本从约 5 亿美元/年降至约 700 万美元/年。

文章围绕 Ramp 客户群数据展开:2022 年 11 月到 2025 年 12 月间,AI 支出最高四分位的公司营收翻倍以上,而零 AI 支出的公司仅增长约 15%。作者归纳了拉开差距的五点做法:重新设计工作流而非在旧流程中塞模型、激励实验、通过工程手段注入业务上下文、认真度量使用与影响,以及最后一条也是文章重点——用强化学习微调开源模型形成”自有智能”。作者认为前沿 API 适合用于原型验证并生成训练数据,而在规模化阶段应切换至针对自身工作流、数据和工具训练的小模型,同时前沿模型仍可在编排层调用这些专家模型。文中也引用了 Bridgewater、Harvey、Intercom Fin Apex 等作为该”打法”的代表案例。

HN 讨论呈现两派。支持者认为大多数业务用例并不需要”会 12 门语言的 50 位博士”,一旦开源权重加上便宜微调服务成为常态,大模型厂商的军备竞赛及其背后的债务驱动基建将失去经济基础,这也是各大实验室对开源权重高度敏感的深层原因。也有开发者分享自己用 Apple 3B Foundation Model 加微调 adapter 在特定任务上逼近 Sonnet 4.6 的经验。质疑派提出两点:一是前沿模型的免费能力提升多次跑赢重新训练的收益,公平比较应对照微调模型维护期内前沿模型的进步;二是 500 美元只是训练账单最便宜的一项,真正昂贵的是数据构建与后期维护——本例的 177k 条打分回合数据是基于 Amazon Berkeley Objects 合成得到,能自然获得如此规模标注数据的场景并不多。还有评论指出 Ramp 的营收对比可能存在因果倒置:营收翻倍的公司本就有钱买 AI。有读者关注具体细节,如评分器是否由前沿模型充当、当微调模型超越前沿模型后评分是否仍然可靠,以及文章中关于”何时微调、何时用前沿模型”的 2x2 决策图。


7. 循序推导 DeltaNet 家族线性注意力:直至 Kimi Delta Attention

Doubleword 的 Jamie Dborin 撰写长文,将 Qwen 和 Kimi 最新模型使用的 Kimi Delta Attention(KDA)从零一步步推导出来,路线为:softmax 注意力 → 线性注意力 → DeltaNet → Gated DeltaNet → KDA,然后再讨论其递归和 chunkwise Triton 实现。文章有意采用量子力学的 bra-ket 记号,并提供一个页面切换开关,可在 bra-ket 与传统向量+转置记号间即时切换。

推导起点是标准因果 softmax 注意力,序列长度 T 下有 T² 个 key-query 对,softmax 的分母使得计算无法重排。去掉 softmax 之后,作者利用外积恒等式 (|v⟩⟨k|)|q⟩=⟨k|q⟩|v⟩,把过去的所有信息压缩为一个固定尺寸 V×K 的状态矩阵 Sₜ = Σ|vᵢ⟩⟨kᵢ|,将注意力变为”写入 + 读取”的递归过程,实现线性复杂度。随后作者指出关键问题:这种写入是 ”+=“,而不是想要的 ”=“;写入一对 |v⟩⟨k| 后,用同一个 k 查询会得到旧值加上新值,非正交的键会相互干扰。DeltaNet 的答案是”写入误差而非写入值”:在写入前先读出 Ŝ|k⟩,只把 β(|v⟩−|v̂⟩) 加入状态,即 delta 规则。文章接着自然过渡到 Gated DeltaNet 引入的对状态的遗忘(Diag(α)),以及 KDA 完整的状态更新方程组,最后带出对底层 Triton kernel 的讨论。

HN 讨论重点集中在记号与可读性上。多位读者称赞 bra-ket 记号让矩阵与标量的形状一目了然,尤其对有物理背景或阅读障碍的读者非常友好,并盛赞记号切换开关的设计。也有人吐槽机器学习领域跨论文缺乏统一记号是长期摩擦点,作者能在开头明确说明记号已属难得。一部分讨论围绕标题的措辞展开:有评论认为”You Could Have Come Up With…”低估了原创工作难度——事后看清晰的东西,事前想出来非常困难,正如许多开发者”发明”某个东西才发现 70 年代早已存在。也有读者怀疑部分段落是 LLM 撰写,或吐槽自己连 JS 二分查找都写不利索。还有链接到另一篇可视化线性注意力教程的补充,以及关于 bra-ket 名称来源(源自 bracket)的科普。


8. Kimi Linear:一种超越全注意力的混合线性注意力架构

Kimi 团队发布的 Kimi Linear 技术报告提出了一种混合式线性注意力架构,据称在短上下文、长上下文以及强化学习扩展等多种场景下,首次在公平对比中超越了传统的全注意力(full attention)。其核心是 Kimi Delta Attention(KDA):一个在 Gated DeltaNet 基础上引入更细粒度门控机制的线性注意力模块,能更有效地利用有限状态 RNN 的记忆容量。作者设计了专门的分块(chunkwise)算法,通过一种特化的 Diagonal-Plus-Low-Rank(DPLR)转移矩阵变体来提升硬件效率,相比通用 DPLR 大幅减少计算量,同时保持与经典 delta rule 的一致性。

模型层面,团队预训练了一个激活参数 3B、总参数 48B 的模型,采用 KDA 与 Multi-Head Latent Attention(MLA)的逐层混合。实验显示,在完全相同的训练配方下,Kimi Linear 在所有评测任务上均显著优于纯 MLA,同时将 KV cache 使用量最多降低 75%,在 1M 上下文的解码吞吐上最高达到 6 倍提升。团队开源了 KDA kernel、vLLM 实现以及预训练与指令微调 checkpoint。

HN 讨论中,有评论指出该论文实为九个月前发布,但因 Kimi 近期大模型发布而重新受到关注,且据称新一代 Kimi 模型正是在此架构基础上扩展而来。有从业者反映已在内部模型试用 KDA,表现优于同类方法,同时提到 Gated DeltaNet 的后续演进版本。也有评论者关注线性注意力混合架构在长上下文检索(needle-in-haystack、RULER 类基准)上的实际表现,指出这类方法过去经常在此处失守,希望看到与同规模全注意力模型的直接对比。还有讨论涉及若非标准 Transformer 架构流行,专用推理硬件公司(如 Etched)的定位将受何影响,以及对 LLM「能力涌现」是否真正随规模突现的哲学质疑。开源发布本身受到较普遍好评。


9. 苹果将 iPhone Upgrade Program 替换为由 Klarna 运营的 Apple Upgrade 租赁计划

苹果宣布用新的 Apple Upgrade 取代已运行多年的 iPhone Upgrade Program,并将该计划扩展到 Mac、iPad、Apple Watch 等更多产品线。两者最核心的差异在于法律与财务结构:旧的 iPhone Upgrade Program 本质是一笔 24 个月 0 息贷款,用户从第一天起即拥有设备;而新的 Apple Upgrade 是一种租赁(lease),设备所有权归苹果,用户按月付租,租期结束后可选择归还或按残值买断。页脚以极小字体注明该项目由 Klarna 运营。

以 iPhone 17 Pro Max 为例,直接购买约 $1199(税后 $1273),而租赁方案 24 个月每月 $34.99,共支付约 $840,租期结束若要买断还需约 $433。16 寸 MacBook Pro 的对应租赁总额约 $2087(36 个月),买断价约 $1000。整体上相当于一笔 3 年半的免息贷款加尾款。此外,iPhone 租赁要求用户在美国接入 AT&T、T-Mobile 或 Verizon 三大运营商之一,不支持 MVNO 直接使用。根据 9to5Mac 报道,iOS 27 代码显示苹果具备在用户漏缴多期后远程降级设备可用性的能力,这被视为 Klarna 降低违约风险、从而愿意接受较低分成的技术前提。

HN 评论呈现两极分化。支持者认为对每 2–3 年就换新机的用户,租赁在现金流与省去二手转卖麻烦上具吸引力,与租车逻辑相似。批评者则指出,苹果市值刚破 5 万亿美元、市盈率 41 倍,通过月付方案面向财务紧张群体持续拉动硬件销售,本质是维持股价的金融化手段。另有评论惋惜 Apple Card 分期方案(除运营商合约外的最简洁购机方式)已于 2023 年被下架,并质疑如果同样的租赁产品由 Klarna 独立品牌推出,社区反应会截然不同。也有人将其视为苹果服务化与订阅化战略在硬件端的延伸。


10. Delayed Gratification:以「最后报道突发新闻」为荣的慢新闻杂志

Delayed Gratification 是自 2011 年以来运营的英国季刊,自称世界上第一本「慢新闻」杂志。其编辑理念是等到事件发生后的几周甚至几个月,再回顾过去三个月里的重要事件,提供有背景、有深度、有独立立场的报道,作为对 24 小时新闻循环的反向补充。杂志以 “Proud to be ‘Last to Breaking News’” 为口号,设计考究,纸张与信息图表制作精良,除季刊外还运营长读文章、播客、信息图课程等内容线。近期已出版第 62 期,涵盖委内瑞拉、伊朗冲突、非洲杯等主题。

HN 讨论围绕新闻业现状展开。多位评论者认为主流媒体质量下滑,很多所谓「新闻」不过是转述官员或政客声明,缺乏基本事实核查;例如美国多次宣布霍尔木兹海峡「已恢复通行」,实际上通过公开的船舶应答机数据即可自行验证,媒体却懒于核实。有观点提出:除宣战、本地服务中断等少数事件外,绝大多数新闻并不需要「即时性」,延后数周甚至数月阅读反而能获得更完整、更少情绪化的图景。24 小时新闻循环被认为在心理层面伤害了大量受众,需要「去程序化」。

有前订户表示杂志本身极佳,但发现自己实际上并没有那么关心时政,因此没能坚持订阅;也有瑞典读者反映内容过于聚焦英国。另一位来自 Tortoise(另一家「慢新闻」机构)的前员工透露,纯会员制在财务上很难持续,最终不得不依赖播客与商业合作。也有评论者分享自建 pipeline:用 Calibre 定期抓取信任的新闻源生成 epub,再借助 LLM 去重、排序,用 Typst 排版成月度私人「报纸」阅读;另一常见做法是订阅《经济学人》纸质版,用「每周一次 + 高订阅费」天然过滤低质内容与参与度诱饵。也有人分享用 RSS 只订阅特定高质量栏目的技巧。


11. macOS Tahoe 26.6 安全更新:修复大量内核与沙盒相关漏洞

苹果发布 macOS Tahoe 26.6 安全更新说明,公开披露了大量 CVE 编号漏洞。类别覆盖沙盒逃逸、路径解析导致的本地提权、内核内存越界读写、代码签名绕过、隐私偏好绕过、指纹识别、联系人未授权访问、音频/媒体文件解析导致的进程崩溃或任意代码执行,以及远程可触发的拒绝服务与内核内存破坏等。修复描述以「改进边界检查」「改进内存处理」「改进状态管理」「附加沙盒限制」「改进路径校验」等标准措辞为主。研究者致谢名单中既包括独立安全研究人员,也涉及 Blackwing Intelligence、CyStack、DBAppSecurity WeBin lab、Beryllium Security 等安全团队,以及 ZDI 项目。同日也为上一代 macOS 15 发布了 15.7.8 安全更新。

HN 评论关注几个方向。一是漏洞类型分布:大量「改进边界检查/内存管理」类描述再次引发关于内存安全语言的讨论,有评论将其换算为工程、QA 与发布团队的人力成本,认为这从经济角度解释了业界近年为何越来越重视内存安全。二是致谢中出现较多「与 Claude 及 Anthropic Research 协作」的署名,而其他实验室相对少见,有人推测苹果可能对多家 AI 实验室都有内部访问,只是此次公开合作偏向 Anthropic;同时也有对 AI 参与漏洞研究获得 CVE 致谢的争议。三是路径解析类漏洞频繁跨 Windows、macOS、Linux 出现,有评论建议是否应重新审视「宽进严出」原则,为文件选择器等场景提供受限的路径解析实现,避免整套 POSIX 语义带来的攻击面。此外,评论中提到 Tahoe 上「快速用户切换」出现严重回归问题,以及有用户因 macOS 26 早期问题选择继续留在 macOS 15。也有评论感叹此次单个 CVE 出现二十位左右研究者同时致谢的「碰撞」现象。


12. Zig 增量编译内部实现解析

Zig 核心团队成员 mlugg 撰文介绍了 Zig 编译器的增量编译机制。经过多个版本迭代,该特性已从概念验证走向可用于真实项目,团队成员日常使用。文中给出的演示:一个像素编辑器 Fizzy 首次构建约 5 秒,后续每次修改的重建仅需 50–70 毫秒。相关能力目前主要在 master 分支可用,稳定版预计在 0.17.0 中完整交付。

文章将编译器管线分为几段介绍。第一段是源文件级别的处理:读入文件、解析 AST、由 AstGen 生成 ZIR(无类型 SSA 中间表示)。这一步是纯函数式的、无共享状态,加上 Zig 采用面向数据设计,ZIR 可通过单次 writev/readv 系统调用直接持久化。这带来了两个好处:一是天然可并行,只需一个受互斥锁保护的已见文件集合;二是易于缓存,只需检测文件变更即可复用 ZIR。这部分优化 Zig 已启用多年。第二段是最难增量化的语义分析,包含类型检查与 comptime 求值。作者强调,能否高效增量取决于语言设计能否将编译切分为可基本独立分析的「分析单元」,并将单元间依赖清晰建模为依赖图。Zig 有意为此调整过语言设计(部分改动曾引发争议),并将需要跟踪的属性精简为 layout、type、value、body 四种。文章之后进一步讨论增量链接:直接将变更后的字节修补进已生成的可执行文件。

HN 讨论热烈。一位 rust-analyzer 团队成员对比 Rust 与 Zig:Rust 的增量系统在理论上并不逊色,但因语言未针对增量编译设计、需要跟踪的属性远多于 Zig,只能采用运行时查询系统跟踪依赖,加之 rustc 代码规模是 Zig 编译器的 10–20 倍,改造难度极高。有评论质疑为何坚持在 Debug 构建中生成一个包含全部代码的巨型二进制,而非按文件切分为大量小共享库以规避二进制修补,作者亦被问及崩溃或 Ctrl+C 中断导致二进制被破坏的边界处理。其他讨论包括:语义分析是否也能覆盖 comptime 计算的常量、增量链接对调试信息(DWARF 等)的修补策略、该机制是否适用于 Release 构建,以及能否作用于 Zig 编译 C 代码的场景。也有评论借机赞叹 Zig 工具链的持续投入,并感叹业界长期不重视编译速度。


13. OpenAI 开源 Codex Security:面向代码库的 AI 安全扫描 CLI 与 SDK

OpenAI 开源了 Codex Security 项目,提供用于代码安全扫描的 CLI 与 SDK。项目此前已作为 Codex 插件存在,此次以独立开源仓库形式发布,仍在快速迭代。Promptfoo 联合创始人、目前在 OpenAI 参与该项目的 Michael 在 HN 上介绍,团队希望收集使用反馈以持续改进。仓库中值得关注的是以英文自然语言编写的「Skill 定义」文件,用来指导 LLM 如何在特定安全场景下工作,被评论者认为具有一定通用参考价值——凭借 OpenAI 的计算资源,这些提示很可能经过较充分的优化,也可能被移植到其他工具中。

HN 讨论集中在几方面。使用体验上,有用户在一个小仓库上运行扫描,任务运行近一小时后被中断,并消耗掉 Pro 套餐一周额度的一半,最终因扫描期间 Git HEAD 变化而失败,反映出长任务缺乏中间进度、token 使用情况等可观测性输出,也提出 CLI 用户体验有改进空间。也有用户反映频繁遇到「你在尝试的操作我们不允许」类错误,希望官方说明工具支持哪些项目类型、如何判断代码所有权(例如是否会拒绝在 Linux 内核补丁上运行)。隐私方面,多位评论者指出扫描依赖上传代码到云端 LLM,对企业机密项目可能不合规。生态层面,有观点认为此类由 AI 大厂推出的安全工具会挤压 Snyk 等传统 SAST/SCA 厂商生存空间,也有人调侃「AI 公司提供安全工具就像纵火犯管理的消防队」,指其既是 AI 生成代码问题的制造者也是解决方案供应者。此外,评论提到阿里巴巴近期也开源了类似的代码审查 CLI 工具。


14. DMARC 公开 14 年,多数企业域名仍未真正强制执行

CipherCue 对其跟踪的 67,336 个企业域名在 2026 年 4 月至 7 月间的 DNS 记录进行了统计。结果显示:45.1% 的域名根本没有 DMARC 记录;在有记录的域名中,42.5%(占全部域名 23.3%)停留在 p=none 仅监控状态,27.7% 使用 p=quarantine,只有 29.7% 使用真正拦截的 p=reject。综合起来,68.4% 的域名要么没有 DMARC,要么记录处于不执行策略状态。p=none 本应是走向强制执行前几周的临时监控阶段,但现实中对大量域名而言已成为永久状态。

作者认为,p=none 难以推进的根本原因不是懒惰或无知,而是「没人能说清到底是谁在以本域名的名义发信」。作者分析了 36,974 条 DMARC 记录中的 rua= 报告地址,共识别出 10,268 个不同的报告接收域名,其中 79%(8,113 个)在数据中只出现过一次。除 Proofpoint、Cloudflare、dmarcian、Brevo、Postmark、Barracuda 等前 60 个可辨识的端点外,长尾里充斥着形如 [email protected] 之类的哈希邮箱,管理员无法直观判断这些报告归属于哪家发送方。要从 p=none 迁到执行策略,就必须逐一识别所有合法发信源,这本质是一项调研任务而非配置变更,极易被无限推迟。文章还给出了 DMARC 报告接收方的生态分布,指出 Brevo、Cloudflare、Postmark 等其实是「顺带」接收报告的邮件基础设施提供商,而 Valimail、dmarcian、Red Sift、EasyDMARC、DMARC Analyzer 等才是核心 DMARC 监控产品。

HN 讨论则暴露了 DMARC 的实际局限。有邮件服务器运营者指出,启用 DMARC 后偶尔会误封客户合法邮件,但绝大多数垃圾邮件与钓鱼邮件本身都通过了 SPF/DKIM/DMARC 校验——这些签名只证明「来自某域」,并不证明「值得信任」,无法解决用户真正关心的「这封信该不该信」的问题。多位管理员反映 Fortune 100 级别公司的 SPF/DKIM 配置错误极多,只能被迫忽略验证失败以避免用户投诉。也有评论建议无邮件用途的域名应至少发布 v=spf1 -allp=reject 的 DMARC 记录以防被滥用,并分享用 LLM 自动化生成正确 DMARC/SPF/DKIM 配置的经验。另有讨论指出真正的问题在于 Gmail、Outlook、Amazon SES 等大厂对滥用报告缺乏有效处理机制,以及部分邮件服务商(如 mailbox.org)因公开域名 DMARC 配置错误率过高而选择不严格遵守 DMARC。


15. Kimi K3 架构解析:从 Kimi Linear 扩展到 2.8T 的开源大模型

Sebastian Raschka 对新发布的开源大模型 Kimi K3 做了架构层面的梳理。K3 是目前最大的开源权重模型,参数量达 2.8T,本质上是去年 Kimi Linear(48B)架构的规模化生产版本,而非从零设计的新架构。

相较 Kimi Linear,K3 主要新增了 LatentMoE 组件,其思路与 Nemotron 3 Ultra 中的实现一致:通过下投影(down-projection)压缩大型线性层,类似 multi-head latent attention(MLA)对注意力层的处理方式。整体来看,K3 与 Nemotron 3、DeepSeek V4 等最新架构表现出共同趋势——用推理效率优化版本替换传统组件:常规 MoE 换成 LatentMoE,常规注意力换成 MLA 与 Kimi Delta Attention(KDA)。

一个不属于效率优化的重要变化是 attention residuals。它与 DeepSeek V4 采用的 mHC(manifold-constrained Hyper-Connections)目的类似——改进残差路径,但方式不同:mHC 拓宽残差通道,而 attention residuals 通过注意力分数作为权重跨层连接残差。技术报告显示,这一设计能稳定改善验证损失和下游表现,代价是训练成本上升约 4%、推理成本上升约 2%。

最引人关注的是位置编码策略:K3 完全去除了 RoPE,全面采用 NoPE(No Positional Embeddings)。近期主流趋势是在局部注意力层(如滑动窗口)用 RoPE、在全局层用 NoPE,而 K3 是作者所知第一个前沿级别、全层 NoPE 的模型。此外,K3 原生支持多模态。

HN 讨论中,多位评论者对全 NoPE 的可行性表示惊讶,猜测线性注意力组件(Kimi Delta)可能在暗中承担位置编码功能,才使模型能”甩掉”RoPE。也有人指出,这类新颖架构选择说明 Kimi 并非某些西方实验室所暗示的”纯粹靠蒸馏”,而是在原创性架构上有实质推进。


16. Steel Bank Common Lisp 发布 2.6.7:新增 AVX512 与 ARM64 SIMD 支持

Steel Bank Common Lisp(SBCL)延续其月度发布节奏,推出 2.6.7 版本。作为 Common Lisp 生态中性能最强的开源实现之一,SBCL 起源于 Carnegie Mellon Common Lisp,“Steel Bank” 一名正是致敬 Carnegie(钢铁)和 Mellon(银行)两位工业大亨的文字游戏。

本次版本更新的亮点集中在 SIMD 支持上:SB-SIMD contrib 现已支持 ARM64(由 Sylvia Harrington 贡献),X86-64 平台新增 AVX512 指令支持(Robert Smith 与 Arthur Miller 贡献),并对两大架构的 SIMD 指令集做了额外增强。

HN 讨论围绕几个方向展开。有开发者好奇 SBCL 的 SIMD 具体工作在哪一层——是编译器代码生成层实现自动向量化,还是必须以 intrinsics 显式调用?这一疑问尚未获得权威回答。也有用户呼吁 SBCL 团队补充内存 arena 特性的正式文档,目前唯一资料只是一份年代久远的提案。

关于生态与实用性讨论也不少。有人回忆过去 Clozure Common Lisp(CCL)在 Windows 支持上占优,而 SBCL 以执行速度见长,好奇如今格局是否依旧。还有评论者对”如果 Lisp 赢得主流之战世界会是什么样”展开设想:部署单元变成 Lisp machine image,Kubernetes、EC2 等基础设施将如何围绕镜像模型重新设计。也有初学者表示对 Common Lisp 感兴趣但找不到合适的现实用例,反映出该语言在现代工程实践中的普及困境。总体上,社区对项目长期稳定推进表示欣慰。


17. Anthropic 用 Claude 发现 HAWK 与降轮 AES 的新密码学攻击

Anthropic 公布了利用 Claude Mythos Preview 在密码学算法本身(而非实现层面)发现数学缺陷的两项研究成果。两项结果均不影响当前生产系统,但展示了前沿 AI 模型在密码分析领域的潜力。

第一项针对 HAWK——NIST 后量子数字签名标准化第三轮候选方案之一,基于格同构问题(Lattice Isomorphism Problem)。尽管 HAWK 已经历两年多的专家评审,Mythos 在约 60 小时内改进了对它的已知最佳攻击,通过发现格中一个此前未被利用的非平凡自同构(nontrivial automorphism),使有效密钥强度实质减半——要维持原安全等级需将密钥长度翻倍。第二项是对降轮 AES 的攻击:Mythos 消除了攻击者需要做的一次猜测,使已知最佳攻击加速 200–800 倍,但攻击对象是弱化版本,完整 AES 未被撼动。

两项研究每项约耗费 10 万美元 API 成本,历时约一周。Anthropic 遵循了负责任披露流程,向 HAWK 作者、NIST 邮件列表及美国政府和行业伙伴提前通报,并联合 ETH Zurich、特拉维夫大学等推出密码分析基准 CryptanalysisBench。

HN 讨论最热的一条是关于研究员实际使用的提示词——包含大量拼写错误和口语化催促(“we want to find something worth publishing”、“we are not looking for low hanging fruit”),令许多沉迷”提示工程”的读者感到反差。也有评论指出,一周烧 10 万美元 token 反映出内部 API 访问速率远高于公开端点,暗示一种”技术贵族化”倾向。技术层面,有评论者精炼总结:AES 攻击是对 7 轮版本已知学术攻击的边际改进,日常 AES 无需担忧;HAWK 结果更有意义,但 HAWK 尚未部署。还有人质疑:“如果是人类研究员发现同样漏洞,反应会有什么不同?“——反思 AI 参与是否会改变披露伦理框架。


18. Google 提出 Beyond Zero:面向 AI 智能体时代的企业安全新范式

Google 在 ACM 期刊发表文章,提出继 2014 年 BeyondCorp 之后的下一代企业安全架构——Beyond Zero。文章认为,BeyondCorp 的核心假设(访问者是人、动作以人类速度发生、应用是合适的信任边界)在 AI 智能体时代已失效,因为 AI 智能体的数据访问频率是人类的十倍以上,且常跨越大规模非结构化数据集进行推理。

Beyond Zero 的核心特性包括:将信任边界从”应用/工具”层面下沉到”单个资源上的单个动作”;混合静态策略与 AI 驱动的动态推理;自动富化上下文(用户身份、意图、数据敏感度、风险缓解手段);由风险信号自动触发深度调查、挑战(challenges)与遏制(containments)。目标是以机器速度评估每秒数千甚至上百万次人类与智能体的访问决策,替代事后 SecOps 审查。文章特别提到”ambient authority”风险——智能体常继承其人类用户的完整权限。

HN 评论普遍持怀疑态度。多位评论者指出这只是把攻击面转移到了那个”负责推理的大脑”上:一旦这个中央决策系统被攻破或被诱导,损失将更集中。安全层可能比业务应用本身还复杂,谁监督监督者?“零信任是确定性的,而 AI 是非确定性的——将访问控制建立在非确定性推理之上是糟糕主意”——这条评论获得广泛认同。文中给出的”管理员登录服务同时在另一窗口查询系统架构基本问题”作为可疑信号的例子,被评论者批评脱离现实,因为几乎每个新到岗管理员都会这么做。还有人推测 Google 收购 Wiz 的高价,正是押注 AI 时代安全成为不可回避的刚需;也有人怀疑,把数据托管给推销此类方案的公司,是否真的比自托管更安全。文章中提到 Claude 曾根据模型训练形成的反射式行为造成非恶意的数据丢失,也被引用来质疑智能体行为控制的复杂性。


19. UNA GPS 智能手表:可维修、USB-C 充电、开放 SDK

苏格兰团队推出的 UNA 是一款主打可维修、可升级、可持续理念的 GPS 智能手表,售价约 240 欧元。其核心卖点是完全模块化设计:用户用一把螺丝刀即可更换电池(280 mAh 硬壳电池,据称是可穿戴设备中的首创)、屏幕和内部组件。充电采用通用 USB-C 而非厂商专用线缆,接口为 IP68 等级。硬件规格包括双频 GPS、6 轴加速度计、常开心率监测、气压高度计,宣称 10 天续航,并可通过 UNA 移动应用同步至 Strava。UNA 还提供开放 SDK,允许开发者访问传感器和数据、构建自定义应用与表盘。

HN 讨论呈现明显的两极。质疑集中在几方面。首先是防水等级:UNA 仅为 IPX5(防泼溅、防淋雨),明确不支持游泳,这在 GPS 运动手表品类中被认为过于薄弱,多位评论者担心一次淋雨过大就可能进水报废。其次是 USB-C 作为手表充电口的做法:一方旅行时因遗失专用线缆吃过亏的用户欢迎标准化;另一方则质疑手表根本无需接触式充电口,无线充电或磁吸更耐用、更防水,暴露的 USB-C 端口本身就是防护弱点。第三是产品评测的匮乏——除三周前的一段开箱视频外几乎没有独立测评,只有基于 PR 稿的转载,令人怀疑其在活动追踪、健康数据算法上的实际表现。

不少 Garmin 用户现身说法,称 2015 年购买的 Forerunner 至今仍表现出色,Garmin 的 Body Battery、HRV 压力算法是核心壁垒,UNA 缺乏成熟算法生态。也有评论者欣赏其理念,希望后续版本引入 USB-C 保护盖、无线充电、真正防水等改进。整体而言,社区对”可维修 GPS 手表”这一定位表示欢迎,但对当前版本的成熟度存疑。


20. ACM 提议将数字图书馆授权给 LLM 训练使用引发争议

Communications of the ACM 刊登观点文章,主张”现在正是把 ACM 数字图书馆开放给 LLM 使用的时机”,探讨对 LLM 授权访问 ACM 内容的商业与许可思路。ACM 数字图书馆是计算机科学领域最重要的论文与出版物集合之一。

HN 上的反应几乎一边倒地批评。最高赞评论来自一位在 ACM 图书馆有多篇论文的研究者,直指此举是”虚伪的大师课”:ACM 是 1947 年成立的非营利组织,宗旨是代表科学家利益,但作者们从未被就此征询意见,且怀疑若真正民主投票多数会员会反对。研究者们提供了知识与专业内容却毫无回报,反而承受 AI 带来的一系列负担——学生的 AI 使用增加了教学工作量、同行评审系统被 AI 生成内容严重破坏。在此背景下 ACM 只考虑”授权变现”这一件事,被认为极其不合时宜。

多位评论者进一步质疑 ACM 是否有权做此决定:IEEE 那样的组织虽然要求作者转让出版权,但训练 LLM 是否属于原始出版权的范围本身就有争议,属于衍生作品的问题需要重新讨论,作者应获得直接的经济补偿而非由出版方代收。也有人提出”这些内容大概率早就被爬取过了”,ACM 现在的动作更像是在既成事实上找补。另一种建议是差别化授权:对开放权重模型免费开放,对闭源模型收费。

还有讽刺声音:ACM 近一年来的期刊内容中 AI 生成成分明显增加,这篇观点文章本身也充满 LLM 常见的语言特征。也有评论者呼吁——如果要给 LLM 访问权,也应同步让所有人类免费访问 ACM 图书馆。围绕 Roko’s basilisk、爬虫带宽成本等边缘话题也有零散讨论,但主线是对学术出版组织在 AI 训练数据许可问题上定位与授权正当性的质疑。