HN Daily Reading · 每日阅读

HN 每日深度阅读 · 2026-07-11

本期主线仍围绕大模型展开:OpenAI 发布 GPT-5.6 三档并声称攻克图论猜想,十二模型横评、开发者恳求 Google 保留旧版 Flash、Mac mini 成本地推理宠儿、极简 C 引擎让 744B MoE 跑进 25GB。

2026.07.11 20 篇摘录

共 20 篇 · 约 12,607 字 · 约 32 分钟读完

1. OpenAI 发布 GPT-5.6 家族:Sol、Terra、Luna 三档模型

OpenAI 正式发布 GPT-5.6 系列模型,包括旗舰 Sol、日常均衡型 Terra 和成本优化型 Luna。官方主打「性价比」路线:Sol 在 Agents’ Last Exam 得分 53.6,比 Claude Fable 5 高 13.1 分;在 Artificial Analysis Coding Agent Index 上以 80 分刷新 SOTA,同时输出 token 减半、耗时减半、成本降低约三分之一。Terra 与 Luna 则声称以约六分之一的成本超越 Fable 5。

新版本引入 ultra 档位,默认并行协调四个 agent 完成复杂任务,并在 BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1 上展示了「更高分、更短时」的前沿曲线。Responses API 中新增 Programmatic Tool Calling,让模型能编写轻量程序协调工具、过滤中间结果,减少与模型的往返轮次。此外 Sol 在计算机操作(OSWorld 2.0 达 62.6%)、前端设计判断、PPT/文档模板遵循等「设计品味」维度有明显提升。

开发者指南透露了几点有意思的使用建议:更短的 system prompt 反而能提升 10–15% 分数并降低 33–67% 成本;模型对「简洁点」这类泛化指令比 5.5 更敏感;建议保留明确的约束和成功标准而非事无巨细地写步骤。

HN 讨论呈现分化。技术侧关注点包括:Sol 成为首个通过验证攻克 ARC-AGI-3 单个游戏的前沿模型(7.8%);有开发者用 RTS 玩具项目测试 Terra,感受与 GPT-5.5 相近、略逊于 Sonnet 5。也有资深用户在真实 agent 评测中发现 Sol/Terra 倾向于「硬啃」问题,反复消耗 token,最终结论与 Opus 4.8、GLM 5.2 一致,但成本高出 2–6 倍,认为其在「何时停下来让用户介入」的判断上偏弱。命名(Sol/Terra/Luna 加 medium/high/xhigh/max/ultra)被普遍吐槽混乱,非拉丁语系用户难以直觉分辨层级。还有人揶揄 OpenAI 在生物学基准 GeneBench 里没有对比 Fable 5,理由是「它拒答大多数问题」——某种意义上算「默认胜出」。长期 Claude Code 用户则在讨论是否值得切换到 Codex,反映生态迁移成本已成为决策关键。


2. Show HN:18 Words 每日限时找词游戏

18 Words 是一款简洁的每日单词挑战小游戏:玩家需在限定时间内用给定字母拼出一个使用全部字母的单词,一天一局。作者同时维护姐妹作 Zanagrams,整体风格延续「经典 Web」气质——纯粹的小型解谜、无广告、无订阅诱导。

HN 讨论集中在游戏机制上。核心争议是计时器:许多玩家表示 30 秒倒计时带来的挫败感——一次卡壳就永久失去满分机会——让人不愿再玩,希望增加「放松模式」或无限时间选项(可加星号标注)。多位评论者建议参考类似作品 23 Words 的做法:即使某个词没答出也继续下一个,最终给出 x/18 的完整分数,配合 Wordle 风格的分享格子;或采用「时间银行」机制,答对补时、答错扣时。其他常见建议包括:字母乱序(shuffle)按钮,帮助卡壳时打破视觉锁定;卡关时给出显字提示而非直接跳过。

评论中还出现有趣的语言学观察:一位 ESL 玩家指出自己无法从字母 D、I 联想到 /daɪ/ 音,因此想不到 DICE,说明这类游戏严重依赖母语者的音位模式识别。另有玩家抱怨题库里出现苏格兰俚语 BAITH,以及 LATER/ALERT 这类互为异位词却只接受一个答案的判定问题。

作者积极响应反馈,次日即发布更新:保留 30 秒计时但改为贯穿全部 18 个词、给出最终 x/18 分数,并新增 Wordle 风格分享功能。首日据称吸引了 132,411 名玩家。


3. Colibri:在 25GB 内存机器上运行 744B 参数的 GLM-5.2

Colibri 是一个用纯 C 写成、零依赖的推理引擎,目标是让 GLM-5.2(744B 参数 MoE 模型)在约 25GB 内存的消费级机器上跑起来。核心思路是利用 MoE 的稀疏特性:每 token 只激活约 40B 参数,其中变化的路由专家仅约 11GB。因此密集部分(注意力、共享专家、embedding 约 17B 参数)以 int4 常驻内存约 9.9GB,而 21,504 个路由专家(每个约 19MB)留在磁盘(约 370GB),按需以每层 LRU 缓存 + 可选热专家 pin + 操作系统 page cache 作为二级缓存的方式流式加载。

引擎单文件约 2400 行 C 代码,无 BLAS、无 Python 运行时、无需 GPU(可选 CUDA 加速热专家)。技术实现包括:MLA 注意力配合压缩 KV-cache(576 floats/token,比原始小 57 倍);DeepSeek-V3 风格 sigmoid 路由;GLM-5.2 原生 MTP 投机解码(需 int8 head,可达 2.2–2.8 tokens/forward);AVX2 整数点积核;异步专家预读;对话跨重启的 KV 持久化;离线 FP8→int4 分片转换器,避免 756GB 全量落盘。

作者给出的诚实数据:WSL2、12 核、25GB 内存、NVMe 环境下,冷启动约 30 秒,冷解码需读约 11GB/token,磁盘随机读上限约 1 GB/s,速度仅 0.05–0.1 tok/s。定位是「用不到一片 H100 散热风扇的价钱,让一个前沿级 744B 模型答得正确」,速度并非目标。

HN 讨论几个焦点:一是文本风格——多位评论者敏锐地发现 README 频繁使用「honest numbers」「honest caveat」这类表达是当下 AI 生成文本的新特征,类似过去的「It’s not X, it’s Y」句式。二是实用性——0.05 tok/s 对多数场景过慢,但有人认为若能达到 1 tok/s、能挂机跑一夜,就已具备实用价值。三是硬件方向——评论认为这类技术很适合 Apple 统一内存 + 高速 SSD 架构;也有人猜想未来会用 NVMe RAID 条带替代昂贵 RAM,从而绕开「内存黑帮」。llama.cpp 支持者指出后者已支持 mmap 和多种量化,Colibri 的独特价值在于极简依赖和从零手写的清晰实现。


4. GPT-5.6 Sol Ultra 声称证明了 Cycle Double Cover 猜想

OpenAI 发布一份三页 PDF,声称由 GPT-5.6 Sol Ultra 独立完成对图论中著名开放问题——Cycle Double Cover 猜想(Tutte、Itai-Rodeh、Szekeres、Seymour 分别提出)的证明。该猜想断言每个无桥无向图都存在一族圈,覆盖每条边恰好两次。

证明思路相当简洁:先援引 Jaeger 的标准归约将问题限制到无环三次图;然后用 Kilpatrick-Jaeger 的 8-flow 定理(等价于 Tutte 的 $\mathbb{F}_2^3$-流定理)给边赋非零 $\Gamma = \mathbb{F}_2^3$ 值;关键新步骤是把这个流「加工」成每边两元素子集 $P_e \subseteq \Gamma$ 的标号,使每个顶点邻边包含每个 $s \in \Gamma$ 的次数为 0 或 2——这直接导出圈双覆盖。核心引理最终归结为一个初等线性代数论证:通过对偶空间证明相关线性方程组有解。写作使用 Codex 配合 GPT-5.6 Sol 完成。

HN 讨论气氛复杂。正面观点:若无误,这是 AI 用现成模型在一小时内攻克图论著名难题的里程碑,类似国际象棋软件超越除大师外所有人的转折点。有资深数学家用同款模型独立复核后倾向认为证明成立。另有评论指出证明「异常简洁」,可能利用了所有专家都错过的巧妙技巧。

争议与反思也不少:一是完整 prompt 中只有约 1/5 与问题本身相关,其余大量篇幅在「催促」模型认真解题、拒绝含糊的乐观汇报、灌输解题策略,反映 agent harness 编排仍很原始。二是有人指出 CDC 猜想在 HN 上唯一一次提及是 14 年前的零票帖子,本来没人真正关心,怀疑关注度更多源自 OpenAI 光环。三是关于「什么才算 AI 数学突破」的讨论:目前 AI 尚未做到自主构建 30 页以上的新理论体系来攻克开放问题,简洁的技巧型证明与「理论构建」性证明仍有质的差别。也有人从更宏观角度评论:可自动化的任务共同特征是——正确性易验证、解可用文本表达、有丰富前人成果,恰好匹配数学与软件工程,而 AI 架构师们容易将自身工作被替代的经验错误外推到所有职业。


5. QuadRF:基于树莓派的相控阵 SDR 可穿墙看 WiFi、追踪无人机

Jeff Geerling 评测了 QuadRF——一款基于树莓派 5 加 FPGA 板、具备皮秒级时序的开源相控阵 SDR 设备。频段覆盖 4.9–6 GHz,可通过波束成形与信号处理实现穿墙可视化 WiFi 信号、追踪空中无人机等应用。基础套件在 Crowd Supply 众筹价 499 美元。

设备开机后树莓派自建 WiFi 热点,通过浏览器 VNC 使用,内置 GNU Radio、SDR 软件及一款 AR 可视化应用,可将 4.9–6 GHz 频段的信号以彩色「光斑」叠加在手机摄像头画面上,不同频道颜色不同。作者用 DJI Mini Pro 4 无人机测试,QuadRF 能在飞行中稳定识别其信号;对邻居 WiFi 热点也能清晰区分。

一个技术亮点是使用树莓派 5 的 MIPI 通道(原本用于摄像头和显示屏)以 >5 Gbps 低延迟全双工流式传输 I/Q 数据,作者团队为此逆向了 RP1 芯片的 MIPI 协议。这样既避开了 USB 的复杂性和瓶颈,又保留 PCIe 接口用于存储或网络扩展,并支持多台 QuadRF 菊花链组合以扩大孔径。该项目属于创始人 Martin McCormick(前 SpaceX Dishy 团队成员)更大的「月球尺度天线阵」计划的组成部分。

HN 讨论中,创作者亲自回帖答疑并展示 demo 视频。热门话题包括:将类似技术做成智能眼镜的想象;对声音做类似定向可视化(声学相机)的类比;用于 EMC 合规测试的可能性;对当前欧洲战场无人机防御的潜在应用。也有评论提醒需明确适用范围——设备主要针对 5.8 GHz 频段的遥控无人机,对 900 MHz 或蜂窝网络无人机无效。多位用户联想到「政府级」监听工具早已存在,认为公开这类工具反而有助于暴露不良安全实践。


6. 青铜时代晚期崩溃:一次简要介绍

历史博客 ACOUP 的 Bret Devereaux 撰文介绍公元前 12 世纪东地中海和中东的青铜时代晚期崩溃(Late Bronze Age Collapse, LBAC)。作者认为,在地中海世界,这是最接近「文明终结」的事件,比西罗马帝国崩溃更严重,但也并非完全彻底。

文章首先勾勒晚期青铜时代(公元前 1500–1200 年)的国际格局:埃及新王国、赫梯帝国、中亚述帝国、卡西特王朝的巴比伦构成所谓「大国协奏」,通过外交、贸易和文化紧密交织。青铜依赖锡和铜——两者几乎从不产于同地——迫使这些帝国维持长距离贸易网络。爱琴海边缘的迈锡尼希腊也参与其中。

崩溃本身表现为公元前 1220 至 1170 年间一系列可考的遗址毁灭层,通常呈由爱琴海经安纳托利亚、黎凡特至埃及的「浪潮」序列,但实际时间线更为复杂:并非所有沿途遗址都被摧毁,部分只是缓慢衰落;有些遗址政治中心被毁但城市延续(如提林斯)。证据主要来自考古而非文字记录,因此存在断代精度与解读上的困难。作者暗示后续会讨论原因(至今仍存较大争议)和长期影响。

HN 讨论呈现多重视角。多位读者推荐 Eric H. Cline 的相关著作,尤其强调他重视持续数百年的严重干旱作为关键因素——这一点评论者认为原文未充分覆盖;也有人推荐 Patrick Wyman 的新书《Lost Worlds》,主张传统「农业→城市→国家」线性叙事有误,历史更像不断的兴衰循环。一个流行的类比是将当时对锡的依赖对应到当代对石油的依赖:资源分布不均、供应链脆弱,任何冲击都可能扩散。也有评论提出有趣假说:贸易网络在崩溃期反而成为灾难的「超级传播者」——港口城市饥荒后,本地船队顺势沿岸掠夺其他城市,形成连锁毁灭。一位希腊读者感慨自己民族经历了多轮兴衰。另有讨论涉及 BC/AD 与 BCE/CE 纪年混用的可读性问题。有志愿者已将文中西班牙语地图翻译成英文上传至 Wikimedia Commons。


7. 纽约市成为美国首个立法禁止欺骗性订阅做法的城市

纽约市通过新规,成为美国首个立法禁止欺骗性订阅与「垃圾费」(junk fees)做法的城市。规则针对当前普遍存在的问题:注册容易、取消极难,以及在结账或入住时才出现的隐藏费用。核心要求是订阅取消流程需与订阅流程同样便利,并要求价格披露更透明。

HN 讨论普遍支持这一方向,但也提出多重现实关切。首先是执行力问题:加州早有类似法律,但对餐厅设有豁免,导致菜单底部小字里的「服务费」「生活方式费」等真正让消费者困扰的分层收费仍然合法;评论者希望纽约版本不留此类漏洞,但目前尚无法完全确认。其次是「landmark」表述被认为言过其实——加州相关规则已实施一段时间,一个讽刺的副作用是《纽约时报》几乎只有加州用户才能顺利取消订阅。

大量评论以自身经历印证问题的严重性:《纽约时报》多年来因取消流程极其繁琐而声名狼藉;Evernote 被指控在用户两次成功取消并彻底删除账户后仍扣款;酒店 check-in 时突然出现的每晚 35 美元「度假村费」预订时并未披露;AT&T 的「行政与监管成本回收费」等运营商附加费也被点名。有评论提到 Nintendo Switch Online 是正面案例——会主动提醒续订与取消选项。另有讨论关注疫情后餐饮、咖啡、外卖等场景中默认预选小费的暗黑模式,认为默认应为「无小费」。

制度层面的讨论也有分量:有人质疑一个五人小镇是否也能有效立法禁止此类做法,反映地方立法的适用边界问题;更多人担忧行业游说会推动联邦层面的先占(preemption)规则来推翻州和城市的严格规定。另有创业者分享经验:让用户轻松取消甚至退款反而暴露了产品真正的问题点,是改进产品的宝贵信号——难以取消的订阅本身往往就是产品质量不佳的征兆。


8. Apple 高管解释 Mac mini 成为 AI 推理热门机型的原因

MacRumors 报道 Apple 芯片资深产品经理 Doug Brooks 的表态:Mac mini 与 Mac Studio 正日益成为运行 AI 智能体(agent)与本地推理任务的首选机型。文章将其归因于 Apple Silicon 的统一内存架构、能效比,以及 macOS 在桌面 GUI 与浏览器工作负载上的原生优势,并强调 Apple 对”端侧智能”未来的战略押注。

HN 讨论围绕几条主线展开。第一类观点认为 Apple 迄今在面向消费者的 AI 体验上乏善可陈,但凭借统一内存 + 隐私 + 低延迟的组合,未来数年很可能成为本地推理的主导平台;有评论者甚至设想 Apple 推出以 Private Cloud Compute 为核心的高价家庭推理设备。第二类声音则从性价比与能耗角度解释现象:在电价高昂的地区,Apple 统一内存方案比 Nvidia GPU 组合运行成本更低,这与当年柴油车因油耗低而流行的逻辑类似。

也有不少务实的反驳。多位用户指出,在 Mac 上折腾本地模型远非顺滑——BF16、FP8、GGUF、MLX 等格式选择混乱,Apple 官方工具链投入有限,主要靠 LMStudio、Ollama、Draw Things 等第三方缓解。有人强调 Mac mini 的真正吸引力并非推理性能,而是运行浏览器与 GUI 应用的单核性能/美元比优于云端 VM,适合作为常驻的”第二大脑”式工作机;也有人质疑原文中”许多 AI 工具是 Mac-first 或 Mac-only”的说法带有明显的公关色彩,因为主流推理引擎与 agent 框架大多跨平台。还有评论指出这一现象带有较强的美国地域性,欧洲等地企业环境仍以 ThinkPad、MacBook 加超大规模云为主。


9. 好工具是隐形的:反对把工具的缺陷包装成”乐趣”

Odin 语言作者 gingerbill 撰文提出:好的工具应当是”隐形的”——熟练使用时应消失在背景中,而不是让用户不断解决它带来的摩擦。他批评一种普遍现象:把工具的缺陷重新包装成”有趣的解谜游戏”,并以此作为工具优越的证明。

作者以 vim 为例(他强调该批评同样适用于其他编辑器):有人炫耀花时间写宏完成一次性文本重构,而在 Sublime 中用多光标或写个脚本一分钟就能搞定。他认为这种”感觉高效”(feeling productive)与”实际高效”(being productive)之间存在明显落差;巧妙解决麻烦问题的愉悦感容易被误认为产出,但真正的检验标准是完成时间与错误数。作者也谈到工具选择成为身份认同后,人们会捍卫甚至炫耀其缺陷,使理性讨论几乎不可能。他还批评”TUI 天然优于 GUI”的论断:GUI 无法用键盘导航不是本质缺陷,而是大多数 GUI 工具没做好;同理,Linux 桌面迟迟未能普及,部分原因是其用户群把折腾配置文件当作乐趣,而普通人只想开箱即用。

HN 评论从多个角度展开。有人从复杂度视角赞同:人类能承受的按钮数量存在硬上限,工具受众越广就必须越简洁,隐形化是自然结果。也有人反驳:界面的”隐形感”其实是时间函数,737 驾驶舱、Bloomberg 终端按钮繁多,但资深用户长期使用后同样会感到透明;有意的摩擦(如合并冲突解决)有时是任务本身必需的。多位终端老用户指出,Shell 管道组合小工具覆盖的用例几乎无穷,但学习曲线陡峭,作者用 Sublime 的经验并不能否定这一点。还有评论提醒:所谓”键盘比鼠标高效”多为主观感受,历次实测结果往往取决于任务细节,用户自称更快时未必真的更快。总体看,社区普遍认可”good defaults + escape hatch”的设计理念,但对作者把偏好差异归结为”炫耀缺陷”持保留态度,认为这混淆了熟悉度与工具优劣。


10. Geohot:为什么我不再直播——奇观文化如何吞噬黑客精神

知名黑客 George Hotz(geohot)撰写了一篇短促而带有情绪色彩的随笔,解释他为何停止直播。他认为杀死他所成长的黑客文化的东西是”奇观”(spectacle):奇观可以被消费而无需参与,且带有信号价值。直播一旦开始,就不再是自我的真实反映,而变成对观众期待的预测,人是渗透性的,无法抗拒这种被塑造。

他将当代生活比作”wireheading”——不与真实世界接触的满足感。观众看直播、看解读视频,感觉像在参与,其实什么也没做;AI 让这种情况恶化:提示词让人以为在”驾驶”,但可能只是被喂养预咀嚼过的内容。他借扫取交友软件资料喂给 ChatGPT 的经验说,个人档案已趋同为营销文案,“社会之镜”反复反射后只剩单调的光。他还感叹逃离已不可能:现实世界只剩商场、斧头投掷馆和密室逃脱;互联网只剩五座企业城和几座难以进入的中文城;旧世界已被竞争淘汰。他把 AI 描述为一场几十年信息战的”原子弹”,新战争索取的不是身体而是内在现实。

HN 讨论褒贬不一。有人指出 Hotz 本人的整个人生就与元评论深度绑定——从越狱 iPhone、逆向 PS3 到 comma.ai、tinygrad——他一贯自我英雄化,反奇观的文章本身也是一种奇观。多位评论认为文章有明显的”中年危机”气味:老世界并未坍塌,只是不再是他熟悉的样子,跨代人都经历过。也有务实建议:查电影时间早已可提前上网解决,“无处可去”往往是”很上网的人”的错觉——去徒步、去线下小社区,旧式互联网(个人博客、非商业化讨论)仍然活跃,只需选择脱离无聊社区。还有人引用《绝命毒师:续命之徒》台词”顺其自然是一种糟糕的哲学”呼应文中对”非驾驶自我”的忧虑,也有人分享参观废弃苏联核掩体时看到 Windows 95 运行 Solitaire 的奇异感受,作为对科技与日常之间张力的注脚。


11. 在 Emacs 里,一切看起来都像一个服务

文章反驳”Emacs 是操作系统”的流行说法,主张更准确的比喻是:Emacs 运行在 OS 之上,具备编排应用与工具的能力,因此在其内部”一切看起来都像一个服务”。作者用 Client-Server 模型分解 Emacs 作为客户端的三大关注点:UI(minibuffer、buffer、completion、tabulated list、transient 等)、Client Edge(url、socket、SMTP、JSON/XML 解析)、Local Database(alist、plist、hash-table、SQLite)。这些能力全部通过 Elisp 这门动态语言编排,既可以调用内建库,也可以把命令行工具”重构”为可通过 shell 调用访问的服务。文中给出一个具体示例:用不到几十行 Elisp 封装 wttr.in 的 JSON 天气服务,在 minibuffer 中显示结果并写入 kill-ring。

HN 讨论延伸出多条线。有人指出这只是把客户端/服务器概念放宽到几乎任何交互都成立,未必带来新洞察;Emacs 更准确的思想源流是 Lisp 机器,只是主流市场未走那条路。相关评论回顾了 Symbolics、Lucid Energize(早期类 LSP 的尝试)等历史。多位长期用户分享经验:Emacs 在 LSP 出现前就有长驻子进程、类 RPC 交互、TRAMP、GUD、REPL 集成等,“一切皆服务”的架构并非始于 LSP。有人把 Emacs 更贴切地描述为”内建文本编辑器的编程环境”,类似 Smalltalk 镜像。也有人分享现实困境:新东家要求全员统一工具链,无法再用 Emacs,只能被迫在多个专用工具间切换,效率明显下降。还有评论提醒 Emacs 可以 —daemon 方式作为服务器运行,多个 emacsclient 共享同一 session,但通过 SSH 转发 socket 让远程客户端连接目前行不通。作者在评论区表示反馈超出预期。


12. Apple 起诉 OpenAI,指控前员工窃取商业机密

Apple 在美国加州北区联邦法院对 OpenAI 及其旗下 io Products 提起诉讼,指控多名前 Apple 员工”为 OpenAI 利益”窃取商业机密。被点名的两名个人被告是曾任 Apple 产品设计副总裁、负责 iPhone 与 Apple Watch 设计的 Tang Tan,以及在 Apple 工作八年的资深系统电气工程师 Chang Liu。Jony Ive、Evans Hankey、Scott Cannon 等同样前 Apple 出身的 io 创始团队成员未被列为个人被告。诉状披露目前已有 400 多名前 Apple 员工在 OpenAI 工作。

Apple 的指控包括几类行为:Tan 在面试仍在职的 Apple 候选人时,利用内部项目代号追问未发布产品进展,并要求候选人携带 Apple 实物零件、CAD 文件、原型进行”show and tell”;一名候选人在面试前数小时开始截屏并下载与某高度机密项目相关的文件;Tan 向即将入职者分发 Apple 内部”Need to Know”文档(含离职安全流程),形成”规避 Apple 安全流程”的固定模式;Liu 被指在离职后利用一个安全漏洞下载了超千页的机密工程文件,包括复杂电路板制造文档,并指导另一名 Apple 员工准备 OpenAI 面试。此外,OpenAI 被指诱导 Apple 一家可信供应商在未获授权的情况下对某设备执行 Apple 专有的金属表面处理工艺,并以内部术语向另一家电源/电池供应商询问特定组件。Apple 称已于今年 2 月向 OpenAI 私下交涉未获回应,并称本次曝光”只是冰山一角”,此案与双方 Siri 集成 ChatGPT 的协议无关。

HN 评论普遍认为,若诉状描述属实,性质远超”带走个人专长跳槽”的范畴,而是有组织地指导员工窃密。多位评论者判断 OpenAI 面临被”重锤”的风险,Apple 的法务资源足以在 discovery 阶段深挖;这一时点也与 OpenAI 推进 IPO、准备发布首款硬件相关,可能带来实质法律负担。也有评论从企业信任角度延伸:一家在硬件领域被指如此行事的公司,让人担忧其如何对待存储在其服务器上的用户数据。少数玩笑评论调侃”这些信息只是用来训练模型的”,以及”硅谷这一季越来越有味道”。


13. 剑桥研究:博科圣地如何使用前沿 AI 辅助恐怖活动

剑桥大学 AI 科学与政策项目(CASP)发布报告,基于 2025–2026 年在尼日利亚东北部对 27 名前博科圣地成员的半结构化访谈,描述该组织两个派系对前沿 AI 的使用情况。报告称 ChatGPT、Claude、Gemini、Grok、Meta AI、DeepSeek 等模型均被用于日常运作与作战辅助,包括袭击策划、武器故障排查、爆炸装置设计等方向,并称部分安全防护被绕过。相关技能通过跨国圣战网络传播,伊斯兰国人员曾提供线下培训。报告指出这种使用已被制度化,设有专门单位与内部培训;受访者对 AI 表现出强烈热情,个别人对大规模杀伤性武器持开放态度,但记录到的实际使用仍属常规。报告结论是:恐怖分子对 AI 的采用已比此前分析所认识到的更系统、更深入,值得政策制定者、安全部门和 AI 开发者关注。

HN 讨论对报告的许多具体说法持明显怀疑。一段被广泛引用的访谈称受访者向 AI 询问所用摩托车型号与目标距离,学习”跨越桥梁”的跳跃技巧,练习中 18 人死亡、8 人成功——评论者认为这更像 AI 输出的荒诞副作用,而非能力体现。另一段”以前派 200 人死 60 人,用 AI 后学会只派 20 人协同攻击”的引用则被广泛认为不合常识,怀疑研究者被受访者戏弄。多位评论者指出,即便是越狱后的模型,在爆炸物制作等话题上的回答通常不超出维基百科水平,难以提供真正被封禁的可操作知识;因此对”AI 提供了实质增量能力”这一核心结论要求更硬的证据。方法论层面,有人认为研究本身尚可,但只有约 15 名受访者了解 AI 使用情况,且多数并非直接使用者,容易受到组织内部宣传的影响——指挥官可能刻意夸大 AI 使用以提振士气。另一类评论则从更广的政策角度反问:恐怖组织也使用搜索引擎、汽车、银行和邮件,若因此监管 AI,逻辑上应同时限制所有通用技术;亦有人担忧此类报道会被用来推动对开源模型的严格 KYC 或禁用。也有评论指出”Boko Haram”字面意为”西方教育是禁忌”,使用西方 AI 存在讽刺意味,并注意到《纽约时报》同期发表了类似主题的文章。


14. 蜗牛牙齿超越蜘蛛丝,成为自然界最强材料(2015)

Smithsonian Magazine 的旧文(2015 年)报道,朴茨茅斯大学研究人员发现帽贝(limpet)牙齿的抗拉强度超过蜘蛛丝,成为已知自然界最强的生物材料。帽贝的牙齿由针铁矿(goethite)纤维与几丁质构成,用于从岩石上刮取藻类。文中用”一根意面挂住 3300 袋一磅糖”来类比其强度。后续研究者也对”抗拉 vs 抗压”的表述做过更正。

HN 讨论散点式展开。有人指出腹足类动物几乎不停在啃食,却能保持牙齿完好,正是靠这种纤维复合结构;也有人分享手指被蛞蝓当作食物时那种”细砂纸”的触感,并附上带有齿舌显微图的论文链接。多条高赞评论集中吐槽用”3300 袋糖”作类比不够直观,建议直接说”能吊起一辆中型汽车”。有人指出牙齿主要承受压缩力而非拉力,报道混淆了两种强度概念,让”最强材料”的说法显得含糊。也有评论把话题引向工程应用(如太空电梯所需材料)以及蜗牛在文化中的地位——从被法国人食用到黏液被抹在脸上,再到牙齿被研究用于制造装甲,还有人回忆中世纪手稿边缘常出现蜗牛装饰的谜团。整体氛围轻松,更多是围绕生物学趣味的闲聊而非深度技术讨论。


15. 成功公司为何会「视力退化」

作者以墨西哥洞穴鱼作为类比:同一物种在河流中拥有正常视力,但在洞穴环境下发育早期便主动关闭造眼程序,把能量转向嗅觉与脂肪储备。眼基因仍在,只是环境不再表达它。作者用这个隐喻描述成功公司出现的「能力盲视」(competence blindness):不是像《创新者窘境》里那样被新市场颠覆而消亡,而是长期存活却逐渐丧失识别工程能力的能力。

其机制大致是:初创进入高速增长期后按人头指标招人,招聘门槛被拉平;只在这家公司待过的工程师一年后进入面试小组,凭「对现有混乱的适应度」筛人。几轮循环后,公司内部充满善意但对糟糕状况毫无察觉的人。外部看品牌、利润、人数都还不错,内部却是只有原作者能跑的流水线、脆弱到需要资深工程师随时待命的部署、几乎等同于象形文字的过期 wiki。认真做工程在这种环境中成为「退化性状」:坚持表达者会在几次提案被否后逐步凋亡。

作者进一步指出「卓越中心」(Center of Excellence)常是问题的放大器:把本该弥散在组织中的工程品味抽取到一个流程部门,用模板与仪式压制它名义上要培育的能力。当市场进入壁垒够高时,洞穴在地质意义上是稳定的,缺乏可信挑战者迫使纪律,于是自称技术公司的机构在会议舞台上说着大厂话术,交付却像 1990 年代的地方公用事业。

作者补充了 Hirschman「退出/发声/忠诚」框架之外的第四种可能:留下本身即是凋亡——适应过程发生在觉察之外,最终与忠诚无法区分。地表种群仍能看见世界,重新游入合适的水域,视力可能恢复。

HN 讨论中,多位从业者共鸣。一位在老牌国防企业工作的评论者更倾向用「停滞」而非「失明」描述:没有财务激励去冒险改流程,把关者、部门墙与风险厌恶联手压制,一旦离开公司能力便回归。另有人现身说法描绘了长期在小项目里被反复晋升、缺乏大型复杂项目历练的管理层与技术负责人如何共同锁死组织。也有观点提醒这更像「情境错配」而非能力丧失,被官僚体系困住的人换到合适环境依然能发挥。还有讨论认为大公司看似不创新,其实是在有意识地压榨用户基础、巩固定价权,「有视力的工程师」也不过是适应了另一种洞穴。也有评论担忧 LLM 会加速这种同质化与代码腐化。


16. 埃及沙漠下发现 1600 年前拜占庭时期失落城市

考古学家在埃及沙漠中发掘出一座距今约 1600 年、可追溯至公元 4 世纪至 7 世纪中期的拜占庭时期城镇遗址,保存状况相当完好,出土物包括一座早期基督教教堂、住宅建筑、钱币以及带文字的遗物。这一时期正值基督教在埃及成为主流宗教、城镇沿尼罗河扩张、埃及作为东罗马帝国最富庶行省之一的阶段,因此该遗址为研究阿拉伯征服前夕中东与北非的城市生活、宗教景观和经济状况提供了新的实物材料。原报道来自《每日邮报》,评论区亦补充了 Archaeology Magazine 和《卫报》等更严肃的信息来源。

HN 讨论主要围绕几个方向。一是历史背景感慨:不少评论者指出 7 世纪伊斯兰征服之前的中东与北非面貌与今日差异极大,此类拜占庭遗址是理解那段过渡期的重要窗口。二是环境与地理疑问:有人追问既然如今是沙漠,古代为何能承载城市,是否存在气候变化或水源改变,涉及尼罗河支流改道、绿洲退化以及区域气候演化等长期讨论的话题。三是媒体来源批评:评论者对《每日邮报》的可靠性持保留态度,主动贴出更专业媒体的链接。此外还有对该遗址已有 YouTube 频道 Ancient Architects 制作了较完整背景介绍的推荐,以及一些带有个人色彩的旅行经历吐槽。整体而言,社区对发现本身表示兴奋,但更希望通过学术媒体获取细节。


17. 十二款大模型同题построить四个应用:GPT-5.6、Grok 4.5、Claude 与 Muse Spark 对比

tryai.dev 延续上一期「模型 build-off」实验,这次把参赛模型扩大到十二个:OpenAI 新发布的 GPT-5.6 三档(Sol/Terra/Luna)、Meta 突然推出的 Muse Spark 1.1、Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5,以及经 Fireworks 部署的开源权重阵营 GLM-5.2、Qwen 3.7 Plus、DeepSeek V4 Pro、Kimi K2.6。每个模型对每项任务尝试五次,公开全部产物供读者自行判断,作者明确声明这不是严格科学评测,仅是观察。

任务包括类 Doom 光线投射迷宫、带打乱和还原动画的 3D 魔方,以及另外两项应用。以光线投射任务为例,评判标准很宽松——只要角色能在迷宫里走动转向即算通过。结果显示 GPT-5.6 Sol 与 Luna 均 5/5 通过,Grok 4.5 也 5/5 且价格低廉,Claude Opus 4.8 稳定但缺乏亮点,GPT-5.5 表现仍强但更贵更慢,Muse Spark 1.1 在成功时质量出色但半数失败,GLM-5.2 虽渲染细节不错却在所有尝试中角色都无法移动。作者结论是 GPT-5.6 系列在短提示延迟上最快、Luna 约 1 秒响应,Qwen 便宜且快,DeepSeek 与 GLM 偏慢。

HN 讨论集中在几点。多位评论者一眼认出文风为 AI 生成,认为工作量值得肯定但机械化的段落让人出戏。也有人质疑「让 agent 一次性生成随机应用」的方法与真实工程开发相差甚远,更接近 LMArena、logic.inc arena 等公开榜单在做的事,而后者也得出 GPT-5.6 与 Claude Fable 5 在 web dev 上并驾齐驱的类似结论。有评论者赞赏这种「乱且真实」的测法比可被刷分的传统基准更接近现实,尤其能揭示中国开源模型可能存在的 benchmax 现象。也有细节质疑,例如 Muse Spark 明显是唯一正确制作出魔方动画的却只拿到 2/5(作者回应是内嵌视频显示问题),以及提示词未公开导致难以复现,可能是 GLM 5.2 完全渲染失败的原因之一。还有观点提醒这类视觉任务更多考察训练数据覆盖度而非推理,模型很难在潜空间里凭空构造魔方几何与动画的推理链。


18. 写给闪卡的一封情书:Anki 与间隔重复在深度学习中的角色

作者长期不看好闪卡,认为它只适合英语单词式的死记硬背,不适用于需要深入理解的 STEM 领域。这种看法在 Reddit 等社区的高赞回答中也很常见。她通过 Coursera 上的 Learning How to Learn 课程重新认识了间隔重复(spaced repetition),并开始把 Anki 作为通用学习工具。之所以认真对待,是因为她自认为记忆力差,尤其数学这种高度累积、当下不常用的学科——微积分、线性代数、概率乃至高中三角都会静静遗忘。而基础不熟练会阻碍抽象层级的「chunking」,因此深度理解型学科同样需要记忆支撑,只是形式不同。

在工具选择上她使用 Anki,虽然对界面陈旧、HTML 编辑器笨拙、文件格式不透明表示不满,但认为其灵活的卡片结构无人可及;曾尝试 Obsidian 的 Spaced Repetition 插件等纯文本方案,均不满足需要。她强调闪卡不替代传统学习,只占学习总时间的一小部分,并给出两条推论:不要背自己不理解的内容;深度学科应优先使用自己写的卡片,而非他人现成卡组——她观察到互联网上大多数分享卡组质量低下,接近机械抄录教科书。

作者的卡片除定义与事实外,还包含直觉与「顿悟时刻」,例如「为何两次反射等价于一次旋转」这类卡片会配图并链接原始笔记与外部资料,她把闪卡制作与数字花园式笔记流程绑定。她也把 Anki 视作一种「周期性任务调度器」,例如为过去做错的数学题单独建卡组,用于安排重做练习。她每天花 1–30 分钟复习,坚持轻量以维持习惯,并强调每张卡都是负担,不需要就删。她承认关于 Anki 本身的实证证据仍薄弱,可能存在自我判断偏差,但主观上一年后仍能从暂停之处捡起学习项目已值得。

HN 讨论热度很高。有 30 多岁的评论者用 Anki 学法语(B2)、下棋、Scrabble 与酒吧问答,认为无法严格证明比其他方法更高效,但主观效果显著。多人赞同「亲手写卡」这一关键点:制作卡片的过程本身就是最深度的一次学习,把这一步做得越省事效果越差。关于 LLM 辅助生成,反方认为直接扔章节让模型「生成 flashcards」的做法产出低质;正方则指出如果构建带工具调用和自我校验的工作流,命中率可以从 10–20% 提升到约 90%。语言学习者提出希望有「音频优先、例句每次变化」的闪卡应用,指出 Anki 在 N3 之后对日语听力帮助有限,因为先看到文字会造成理解假象。也有人分享用大号点阵卡片做「主题聚合式」轻量笔记(如 sqlite 命令表)而非逐条卡片的做法。关于用 Anki 学习纯数学或物理等概念性学科,评论者讨论了传统「卡片要简短」原则在这类主题上可能需要打破。


19. 《终结者 2》的视觉技术口述史

vfxblog 借《终结者 2:审判日》3D 重映之机,采访了十余位当年 ILM 参与项目的技术人员,回顾了 1991 年这部影片如何在 CG 尚处萌芽阶段实现液态金属 T-1000 的关键镜头。彼时 ILM 位于圣拉斐尔,计算机图形部门规模很小,刚刚在 James Cameron 的《深渊》中初步验证了数字视效的可能性。为完成 T-1000 只有为数不多但极具挑战的几个镜头,团队必须几乎从零发明工具与流程。

文章通过多位当事人的回忆,串联出当时的工作氛围与人才网络:Tom Williams 同时在 Pixar 和 ILM 全职工作到几乎在通勤中睡着;Eric Enderton 成为 ILM CG 组第一位专职软件开发者,此前所有软件都由做镜头的人兼职编写;Steve「Spaz」Williams 从 Alias 加入并推动视频动画方向;Stefen Fangmeier 等技术总监需要自己写 C-shell 脚本做逐帧批处理,如今这些能力已被商业软件封装。围绕「Make Sticky」「Body Sock」等专用工具,团队解决了将 CG 液态金属贴合演员身体、跟随表演变形等一系列前所未有的问题;许多镜头也依赖 Doug Chiang 等艺术指导手工数字修补。文章强调,当年 Photoshop 才发布不到一年,很多现代 VFX 的观念与工具就是在这样「一个不可能问题接一个不可能问题」的攻关中诞生的。

HN 评论区补充了若干看点。有人指出液态金属子弹击中身体的实拍 squib(假血包)至今仍是最出色的实用特效之一,提醒读者影片大量效果其实是实景与模型制作而非 CG。多位评论者补充 Softimage 也在 T2 中扮演重要角色,并推荐纪录片《Jurassic Punk》,其讲述了 Steve「Spaz」Williams 在 T2 与《侏罗纪公园》中的贡献以及 ILM 内部政治。有人追问高速直升机从立交桥下穿过的镜头是否真为特技飞行。还有评论感慨当代 CGI 未必能像 T2 一样经受时间考验,并回忆彼时电影发行的文化冲击:在多厅影院尚未普及、宣传节奏依赖口碑的年代,T2 上映数周后仍在从早到晚循环放映,其文化影响力远超当代漫威或星战续作。也有人希望有人能整理片中 John Connor 用来「破解 ATM」的道具与 Cyberdyne 办公室里那些 gadget 的技术细节,这方面记载明显更少。


20. 开发者集体请求 Google 不要下线 Gemini 2.5 Flash

在 Google AI 开发者论坛上,一条题为「请不要下线 Gemini 2.5 Flash」的帖子聚集了多位依赖该模型的开发者。发帖人 Nick_D 表示,团队有些工作流对 2.5 Flash 高度定制,内部基准测试显示 Gemini 3 Flash 即便按照新版提示指南调整也无法达到同等表现,迁移不存在简单开关。跟帖者 Ruthvik 附和称与 2.5 Flash 在延迟与性能上最接近的 3.1 Flash Lite 差距明显,还出现思考内容外泄问题,并推测 2.5 Flash 承担了 Google 大量流量。来自澳大利亚的 Joshua_Simpson 强调 2.5 Flash 是当地唯一部署的低延迟模型,可以做到 300–400ms 补全用于语音 agent,而 3.5 Flash 无澳洲部署,实际延迟接近 700–800ms,语音场景完全被打破。tylertreat 指出 3.5 Flash 价格约为 2.5 Flash 的三倍,与 Flash 系列定位的低成本初衷相背,暗示廉价 AI 时代可能正在结束。多位开发者表示若真下线将转向开源权重模型而非升级到 3.5 Flash。

HN 讨论几乎一边倒地指向云端模型的根本风险。最高赞观点认为这就是「云模型的通病」:辛苦打磨的确定性工作流会被一次强制升级替换成表现不同、价格更高的版本;只有本地部署的模型才能免于被下线。有人对 gpt-5-nano 将于 2026 年 12 月 EOL 有类似担忧,并观察到开源模型(如 DeepSeek V4 Flash)已比 gpt-5-nano 更便宜,即便暂时不打算自建推理,也保留了退路。一些评论者提醒「对特定模型过度依恋本身就是气味」,翻出年初「请不要下线 gemini-2.0-flash」的类似帖子,指出这是循环发生的事件;针对 Google 尤其如此,公司以频繁砍产品闻名,「不要在生产环境依赖 Google」被反复提及。也有开发者分享类似经历,例如 qwen-2.5-coder 被公司内部模型清单撤下导致工具链断裂,最终以 deepseek-v4-flash 替代。若干评论呼吁应有「Stop Killing AI」式运动,要求付费 AI 服务在下线时公开模型权重,让依赖它的生产工作流至少保留自托管的可能。也有人调侃这种反复优化提示 → 新模型发布 → 重来一遍的循环,「不如干脆变成 Cursor 并从中收费」。