今天聊聊 9 月 27 日的几件事。
AI 这边,有人只丢给模型一句话,它就把理论物理保持三年的计算纪录给破了;编程工具那边,一个亲手做"计划"产品的创始人公开宣布此路不通。机器人那边更实在——不进展台进车间,连续打卡已经满三个月了。
一条一条说。一、Claude 算出九圈散射振幅,理论物理三年纪录作古
9 月 25 日,Anthropic 在官网刊出一篇客座文章,9 月 27 日央广网等集中报道:Claude 完成了平面 N=4 超杨-米尔斯理论六粒子散射振幅的九圈计算。
别被名词吓住,重点就三个:
第一,这是真纪录。散射振幅是理论物理里最繁重的符号计算之一,每多算一圈,历史上都要顶尖团队花好几年。此前最高纪录是八圈,由 SLAC 国家加速器实验室的 Lance Dixon 团队在 2023 年创下。
第二,过程便宜得离谱。研究者只给了一句任务描述,之后的"指导"基本只剩"继续"。Claude 用两种独立方法互相校验,其中数值计算部分就是 96 个 CPU 跑一周,约 100 美元;把长时间调用 Claude 的费用全算上,一条完整路线也就 1000 到 2000 美元——一张会议差旅的账单。
第三,人类专家认账。八圈纪录的创造者 Dixon 本人独立验证了结果,说自己"原本认为九圈直接计算太难",甚至直言 Claude 比任何人都更懂他们团队那两篇论文。
这件事的起点是一封公开"战书":8 月 7 日,前理论物理学家 Matt von Hippel 在博客上点名 AI 公司——用学者负担得起的算力,来解决我领域的真问题。一个多月后,战书被接了。
也要说清楚边界:Claude 没有发明新方法,只是把人类已建立的方法完整跑通。中科院何颂团队同期也在 GPT-6 辅助下独立推进到了九圈的主要结果。
真正的信号是:科学计算的成本结构变了。以前这类题目只有精英机构碰得起,现在一个小组加几千美元预算就能上桌。前沿科学验证,正在变成模型军备赛的硬赛道。二、美团 LongCat-2.5 上线:1.6 万亿参数,点名适配 Claude Code
9 月 25 日,美团 LongCat 开放平台上线 LongCat-2.5-Preview,周末两天持续发酵。
硬指标:MoE 架构,总参数约 1.6 万亿,每次推理只激活约 480 亿;原生支持 100 万 token 上下文;新增图片理解,能看截图、图表做视觉推理。
但比参数更有意思的是它的发布话术——几乎句句指向 Agent 生产环境:长程任务、工具调用、多步规划,Coding 能力单独成段,直接点名与 Claude Code、Hermes、OpenClaw、OpenCode、Kilo Code 高效协同。
价格也很凶:限时输入每百万 token 0.30 美元,缓存命中只要 0.006,老用户直接送 500 万 token。
看明白了吗?国产大模型的竞争已经从"跑分榜"卷到"进工具链"。Kimi K3、DeepSeek V4、GLM、LongCat,几个万亿级 MoE 在同一个 Agentic Coding 战场贴身肉搏。
模型厂商打得越凶,开发者越舒服——又好又便宜的选项,肉眼可见地变多了。三、EverMind 开源 Raven V0.2.0:让 AI 自我进化发生在"工作方式"层
9 月 27 日机器之心报道,EverMind 开源了 Raven V0.2.0,提了个反主流的观点。
大家都在等"模型自己改模型参数"的递归自我改进(RSI)。Raven 说,等等,人脑不是这么工作的——皮层慢速沉淀能力,海马快速适应新经历。对应到 AI 系统:模型参数像皮层,而记忆、技能、提示词、控制代码、决策策略这些 Harness 层的东西,才像海马,应该快速进化。
所以 Raven 把 Harness 里可被 AI 改写的部分拆成四类:Modules、Code、Prompt、Policy,每一类都能独立替换。AI 根据任务中积累的反馈,自己改自己的工作方式。在此之上还有一个 The Harness of Harnesses,统一编排 Claude Code、Codex 这些专业 Agent 组队干活。
官方评测里,多 Agent 编排、深度研究、编码、设计、持续执行多项结果,优于同底座模型下对比的 Harness。
为什么值得看?因为"模型不动、工作方式自我进化"是目前工程上最可落地的 RSI 形态。提示词靠人调、流程靠人写、出错靠人修的时代,可能比我们想的更快结束。四、"Plan 模式已死":亲手做计划产品的人,宣布认输
这条是周末 Hacker News 上最火的帖子,9 月 27 日机器之心出了编译。
作者叫 Ayman Nadeem,YC 孵化的 AI 编程公司 Nuanced 的创始人。今年早些时候,她坚信"计划"会成为 AI 编程最重要的环节——先写好需求、架构、步骤,再交给 Agent——还围绕这个判断做了一整套桌面应用。
几个月后,她发帖认输:《Plan mode is dead》。
她的复盘很诚实。计划模式过去干两件事:给 Agent 足够精确的指令;帮人理解自己在构建什么。模型变强之后,第一件事迅速过时了。第二件事更重要了,但计划模式接不住——尤其当你用 Conductor、Codex 同时并行跑好几个 Agent 的时候。
最扎心的是这句:她发现自己"很难集中注意力,很难深入理解正在做的事情",精神上与工作脱节,"甚至有些像行尸走肉"。
这不是一个产品的失败,是整个交互范式在松动:从"事前写计划约束 AI",转向"AI 直接干、人做验收"。
而她点出的真问题至今没有好答案——并行 Agent 时代,人怎么保持对系统的理解?谁能解决这个,谁就可能定义下一代编程工具的界面。五、环球网调查"实干时代":机器人进厂,打卡满三个月
9 月 27 日,环球网发了一篇中国具身智能产业的深度调查,标题就问:进入"实干时代"了吗?
里面的数字挺硬。
宁德时代量产线上,银河通用的重载人形 Galbot S1 双臂抱起几十公斤的料箱送工位,纯视觉自主行动。今年 3 月验收以来,7×24 小时连续干了超过 3 个月——官方口径里,这是全球人形机器人在新能源智能制造场景第一次"常态化自主作业"。银河通用的商业部署规模已经破千台,客户名单里有宁德时代、博世、丰田、上汽。
南昌龙旗科技工厂,8 台智元精灵 G2 承接平板质检全工段,效率达到人类工人的 80% 到 90%,连续运行超 3000 小时。
杭州还有一所"机器人学校",一期 4 台"毕业":一台受聘中国历代绘画大系典藏馆当导览,一台去天津雀巢车间巡检,一台钢琴机器人马上要赴韩国演出。
快思研究院田丰的判断很到位:表演让观众印象深刻,工作必须让生产经理满意——现在正是从"能表演"跨进"能干活"的验证期。
注意衡量标尺的变化:不看翻跟头了,看连续运行时长、效率达成率、复购。这些数字第一次让"机器人进厂"从 PR 话术变成可以核对的运营指标。
验证期之后,才是真考验。
每天写这些文章,配图都要反复压到合适大小,干脆自己做了个本地处理的图片工具「缩图小吴」——压缩、转格式、裁剪、调尺寸一条龙,所有处理都在本地完成、不上传,顺手分享给同样被图片体积折磨的人 👇
OCR:IMG:05 NEWS05 Plan模式已死 亲手做计划产品的人认输
OCR:IMG:AI DAILY 2026年9月28日·A1日报 句话算出物理新纪录,机器, 进厂打卡三个月 公众号·无糖码
OCR:IMG:02 NEWS02 Claude算出九圈散射振幅 一句话打破三年物理纪录 公众号·无糖码
OCR:IMG:02 NEWS02 Claude算出九圈散射振幅 一句话打破三年物理纪录
OCR:IMG:06 NEWS06 机器人进厂打卡满三个月 7×24连续作业成新标尺
OCR:IMG:06 NEWS06 机器人进厂打卡满三个月 7×24连续作业成新标尺 公众号·无糖码
OCR:IMG:04 NEWS04 RavenV0.2.0开源 让自我进化发生在Harness层 公众号·无糖码
OCR:IMG:今天的AI世界,先聊到这 每天00:30更新·关注AlCoding与具身智能 AIDAILY·2026-09-28
OCR:IMG:03 NEWS03 美团 LongCat-2.5上线 1.6万亿参数点名适配ClaudeCode 公众号·无糖码
OCR:IMG:AI DAILY 2026年9月28日·A1日报 句话算出物理新纪录,机器 进厂打卡三个月
OCR:IMG:今天的AI世界,先聊到这 每天00:30更新·关注AlCoding与具身智能 AIDAILY·2026-09-28 公众号·无糖码
OCR:IMG:05 NEWS05 Plan模式已死 亲手做计划产品的人认输 公众号·无糖码
OCR:IMG:AIDAILY 2026年9月28日·A1日报 句话算出物理新纪录,机器 进厂打卡三个月
OCR:IMG:03 NEWS03 美团 LongCat-2.5上线 1.6万亿参数点名适配ClaudeCode
OCR:IMG:04 NEWS04 RavenV0.2.0开源 让自我进化发生在Harness层