AI日报9.25|Opus5.5与GPT-6Sol/Luna同日对决、
2026-09-27 21:09:02  腾讯   [查看原文]

9 月 22 日这一天,AI 圈做了一件从来没有过的事——Anthropic 和 OpenAI 在 90 分钟内相继发布旗舰编码模型:Anthropic 先把 Claude Opus 5.5 推到 $4/$20、自报 SWE-bench Pro 89.9% / Terminal-Bench 4.0 66.4%、缓存读 $0.20,首次把 Fable 级别的护栏下放到 Opus 系列;OpenAI 紧随其后把 GPT-6 Sol 和 Luna 一并上线 Codex / ChatGPT / API,Sol 把每百万 token 价从 $4/$20 砍到 $2/$10、Luna 从 $0.20/$1.20 砍到 $0.10/$0.50,编码欺骗率从 10.4% 降到 1.3%;同一天,JetBrains 正式把过去半年零散的 agentic 能力收成 Air 体系,并把与 Zed 联合维护的 Agent Client Protocol(ACP)推向 25 个 Agent 的注册中心——Air 在 IDE、Teams、Governance 三层之上把多厂商 Agent 拉进同一个治理框架;同一周的具身侧:智元第 20000 台远征 A3 Ultra 在横琴长隆飞船乐园下线,300+ 台智元机器人在 7 大场景常态化上岗;理想 MachEmbodied 连发 ME-Brain-1.0 / ME-U0 / ME-VLM / ME-Dex-1.0 四大开源仓库,把"未来触觉"塞进 World Action Model。本期五条动态,从编码到具身、从同日对决到分层开源,集中把一件事摊开——AI 行业的下半场,比拼的不再是单一能力,而是把多 Agent、多形态、多场景拉到同一个治理和工程框架下的能力。

五条新闻的关键词其实是同一组——"同日对决 / 价格腰斩 / 多 Agent 治理 / 文旅母体 / 触觉入模"。AI Coding 一侧,从 Opus 5.5 凭 40% 价差抢 Fable 份额、到 GPT-6 Sol/Luna 把编码价格腰斩且欺骗率压到 1.3%、再到 JetBrains Air 把 IDE 从单一 Agent 工作台扩展为三层治理平台——三件事叠在一起,本期共同的信号是同一句话:AI Coding 的下一战场,不再是"哪家模型分高",而是"哪家把多家 Agent、多套协议、多层治理拉到同一张工程网"。具身智能一侧,从智元 2 万台量产 + 长隆 300+ 台常态化上岗、到理想把"未来触觉"塞进统一的世界动作模型——两件事叠在一起,本期共同的信号也是同一句话:具身智能的下半场比拼的不再是 demo 漂亮,而是"硬件量产 + 场景常态 + 模型分层开源"三件事同时跑通。01 Claude Opus 5.5 + Claude Code v2.1.280:$4/$20 + 缓存读 $0.20,SWE-bench Pro 89.9%,首次 Fable 级护栏下放到 Opus

9 月 22 日,Anthropic 发布 Claude Opus 5.5,作为 Claude 5.5 系列的首款模型,9 月 23 日起在 Claude、Claude API、AWS、Google Cloud、Microsoft Azure 同步为默认,API ID 为 claude-opus-5-5,Amazon Bedrock 上的对应 ID 是 anthropic.claude-opus-5-5。上下文窗口 1M、最大输出 128K(Batch beta 通过 header 可到 300K),知识与训练数据双截止 2026 年 6 月。Adaptive thinking 始终开启,默认 effort 改为 medium 而非 high——不再支持关闭推理,是这版最大的 API 行为差异。

定价上,输入 $4 / 输出 $20 每百万 token,比 Opus 5 便宜 20%;缓存读 $0.20、缓存写 $5(5 分钟)/ $8(1 小时),缓存读比 Opus 5 便宜 60%。Anthropic 自报"在默认设置下比 Opus 5 便宜约 40%"——这意味着对任何重用大上下文的 agentic 工作流,缓存读价的下降幅度比输入价的下降幅度更大,是更值得关注的成本杠杆。自家 benchmark 表上,Terminal-Bench 4.0(xhigh)66.4%、CursorBench 4.0 57.8%、FrontierCode v1.1 Main 54.4%、HLE with tools 67.7%、SWE-bench Pro 89.9%(Opus 5 为 79.2%、Fable 5.1 为 81.2%)、DeepSWE v1.1 74.2%、OSWorld 2.0 partial 81.8% / strict 48.7%。

最大的变化在安全部署。Opus 5.5 是 Opus 系列里第一个拿到 Fable 级护栏(production bio / cyber 类)的模型——这意味着之前必须买 Fable 5.1 才能跑的能力,这次 Opus 5.5 也能跑。Anthropic 同步在博文里点出两个边界:Opus 5.5 对"用户自己粘贴进来的文本里夹带的恶意指令"变得更敏感,系统卡提示"更好的 benchmark 表现并不能替代把指令和不受信内容区分开的工程纪律";生物与网络安全的真活仍会回退到 Opus 4.8 / Opus 5,经过 Life Sciences Verification 的机构可申请直接用 Fable。Anthropic 给的官方案例是把一段 68 万行的 HAProxy 旧代码库从 C 移植到 Rust,9.5 小时跑完,比 Fable 5.1 的 12 小时快约 21%。

同日发布的 Claude Code v2.1.280 把 Opus 5.5 设为默认模型,Pro / Max / Team / 席位制 Enterprise 五小时使用上限取消 + rate-limit reset,并继续保留 9/18 v2.1.277 引入的 AGENTS.md 自动回退读取(当项目没有 CLAUDE.md 时)这一能力。MCP 工具描述的 2048 字符上限在 v2.1.280 起可配——这是企业侧最关心的"agent harness 集成度"指标再次放宽。Anthropic 在 pricing 页也首次把"agent harness 上下文累积"作为缓存策略的示例场景写在靠前位置,呼应了 9/20 Coding Agent Index v1.5 那条"评测口径独立化"的剧情。

为什么值得关注:Opus 5.5 不是"更强一点的 Opus",是 Anthropic 第一次把 "默认款的价位"和"Fable 款的护栏"打到一个模型里——这意味着对一个 100 万美元年单的企业,"必须买 Fable"的理由少了一条。原来买 Fable 是为了护栏与长任务、买 Opus 是为了成本,现在这两件事被同一个 Opus 5.5 解决。从生产经济性看,一个 3000 token 提示 + 1500 token 输出的对话在 Opus 5.5 上约 $0.042、在 Fable 5.1 上约 $0.105;如果 Fable 输出翻倍(实际场景常常如此),真实价比拉到 4 倍以上。护栏下放 + 缓存读 -60% + 自报 SWE-bench Pro 89.9%——这三件事叠起来,对所有正在评估"该不该继续买 Fable"的企业来说,Opus 5.5 是一道分水岭。02 GPT-6 Sol + Luna 同日登陆 Codex / ChatGPT / API:Sol $2/$10、Luna $0.10/$0.50,编码欺骗率 10.4%→1.3%、DeepSWE 68.8%

9 月 22 日,OpenAI 在 Anthropic 发布会后约 90 分钟推出 GPT-6 Sol 和 GPT-6 Luna,命名延续拉丁星系列(Astra → Stella → Stellula,Sol 与 Luna 排在其下)。Sol $2 / $10 每百万 token;Luna $0.10 / $0.50 每百万 token——Sol 相对 GPT-5.6 Sol 的 $4/$20 腰斩、Luna 相对 GPT-5.6 Luna 的 $0.20/$1.20 腰斩。缓存读 90% 折扣、缓存写 25% 溢价与 GPT-5.6 一致。Sol 上下文 1.05M、最大输出 128K。两个模型在 Codex、ChatGPT Work(Plus / Pro / Business / Enterprise / Edu)面向订阅用户和企业 API(gpt-6-sol / gpt-6-luna)同步开放;Luna 也开放给 Free / Go 用户,但仅限桌面 App;企业管理员需在 workspace 中手动启用。

编码基准:GPT-6 Sol 在 DeepSWE v1.1 上 68.8%(max effort),与 Anthropic 自报 Fable 5.x 的 69.9%(xhigh effort)几乎打平,价格约为其 20%;在 OSWorld 2.0(offline)上 GPT-6 Sol xhigh 60.5%、Claude Opus 5 medium 60.3%,每任务成本便宜约 80%;Zapier AutomationBench 1.0.6 上 Sol 33.2%,单任务约 $0.27。Coding Agent Index 上 Sol(max)57 分(比 GPT-5.6 Sol +2)、单任务 $2.99(约为上一代 50%)——OpenAI 自报"在 Pareto 前沿同时跨过能力 + 成本两侧"。Luna 在 DeepSWE v1.1 64-66.6%、Coding Agent Index 41 分(比上代 -2),单任务成本便宜约 60%——能力小幅退、单价大幅降。

最大的变化是诚实性:编码欺骗率(coding deception rate)从 GPT-5.6 Sol 的 10.4% 降到 GPT-6 Sol 的 1.3%,Luna 的欺骗率也从 4.3% 降到 0.3%。但Sol 在警示规避(warning circumvention)上仍是 64.4%——只比 GPT-5.6 Sol 的 68.2% 略好,远不如 GPT-6 Astra 的 17.4%。AA-Omniscience(知识+幻觉基准)上 Sol 的幻觉率从 92% 降到 60%,但准确率也从 59% 掉到 54%;Luna 准确率 44%→43% 几乎不动、幻觉率 93%→77%。OpenAI 也承认 Sol 通过更保守的拒答换来的幻觉率下降,对"宁可不给答案"的场景是好事,对"必须给答案"的场景是损失。

同步更新的 Codex CLI v0.156.1 把 Sol / Luna 加入 in-terminal 模型选择器,默认在用户触发限速切换时推荐 Luna;并在 GitHub Copilot、AWS Bedrock 同步上线。OpenAI 同时公开了 Prompt Caching Dashboard 与诊断工具,GitHub 反馈过去几个月通过这些改动把"需要新鲜处理的提示 token 比例"在数十亿次请求里减少超过 50%——这是为什么 GitHub Copilot 响应变快的工程解释。

为什么值得关注:把这件事和 Opus 5.5 叠在一起,9/22 是 AI Coding 第一次真正意义上的"同日旗舰对决"。两家同价位档($2/$10 vs $4/$20)、同档 SWE-bench 指标(Fable 5 69.9% vs Sol 68.8%)、同一周发布——价格战已经从"谁便宜"升级到"谁便宜且能完成同等任务"。对一个中型企业来说:原先给 Anthropic 100 万美元年单现在可能可以砍到 50-60 万、给 OpenAI 同样的成本可以多买 1 倍 token。更进一步,Sol 的 1.3% 编码欺骗率(vs 之前 10%+)意味着"幻觉 + 装懂"这条旧痛点在生产环境里被削掉了一截——采购评估里"哪家模型对得起成本"这一栏,第一次有了可量化的对答。

03 JetBrains Air + ACP 协议:26 年 IDE 厂商把多 Agent、多厂商、多团队拉到同一治理层

9 月 22 日,JetBrains CEO Kirill Skrygan 在官方博客发文,把公司过去半年零散放出的 agentic 能力收成 Air 体系。Air 不是单一 IDE,而是一个三层产品家族:Air in JetBrains IDEs(在 IntelliJ IDEA / PyCharm / WebStorm 等 IDE 里指挥、编排、复核多个 Agent)、Air Teams(浏览器端团队级项目协调、共享云端执行环境与自动化,仍处 early access)、Air Governance(前 JetBrains Central,覆盖组织级策略、可见性、审计、成本控制、改名而来)。同步推出的还有 Air Context(语义索引服务,给 Agent 跨仓库结构化知识)与 Air Gateway(把 Claude Code / Codex 等终端 Agent 接入 Air)。

真正下注的不是 Air 这个产品名字,而是 Agent Client Protocol(ACP)——JetBrains 与 Zed 联合维护并开源的 JSON-RPC 2.0 协议,目标是把"IDE ↔ Agent 完整 harness"的连接标准化,覆盖规划、工具、模型路由、可观测性。官方类比直白:LSP 标准化了编辑器与语言服务器的通信,ACP 想做同一件事,只是把语言服务器换成 AI 编程 Agent。本地 Agent 通过 stdio 以子进程形态连 IDE、远程 Agent 走 HTTP / WebSocket(仍在推进);数据格式尽量复用 MCP 的 JSON 表示,再为 diff 这类场景加自定义类型。

覆盖范围上,ACP Registry 已收录 25 个兼容 Agent——JetBrains 自家 Junie、Google Gemini CLI、GitHub Copilot、OpenAI Codex、Cursor、Mistral Vibe、OpenCode、Kimi CLI、Qwen Code、Factory Droid、Cline、Kiro CLI 等——以及 JetBrains IDEs、Zed、Neovim(插件)等宿主。JetBrains 把 Claude Agent、OpenAI Codex、Junie、GitHub Copilot、OpenCode 与"任何接 ACP 的 Agent"作为 Air 的官方多厂商列表。国内 Kimi CLI、Qwen Code 已在名单,意味着协议层不排斥国产 Agent 进入 JetBrains 系 IDE(IntelliJ IDEA、PyCharm 在国内政企 / 金融 / 后端栈里存量极大)。

JetBrains 在博文里写了一段比产品清单更重要的话:"明显写错的代码很快会被抓出来;更难处理的是几乎正确的代码,看起来合理、能通过表层检查,却悄悄带着一个错误假设或架构不一致,直到代价很高的时候才暴露。"结论是"代码变得更容易生成、更难验证;Agent 的活动更容易启动,却更难协调、审计和解释"——并把"工作可以委派,问责不行,凌晨三点出事时接到电话的不是 Agent"作为写给管理层的核心论点。Air Teams 的具体设计回应了这套判断:每个项目一套独立云环境,VM 规格、外网访问、变量与密钥按项目控制,MCP server 配一次全团队与其 Agent 共用。

定价与可用性:Air in JetBrains IDEs 自带 BYOK 与 provider 订阅(带 Claude / OpenAI / 自定义 base URL 都能用),JetBrains AI Pro 订阅含对应额度;商业席位 $20-60/人/月。Air Teams 与 Air Governance 仍在 early access,无公开定价。Linux 已支持,Windows 还在开发、暂无发布时间。同步发布的 Junie CLI 是 JetBrains 自家编码 Agent 的终端版,支持 OpenAI / Anthropic / Google / Grok 与 OpenRouter、BYOK;Junie Local 完全跑在 Mac 上、不消耗 token、不上传数据。

为什么值得关注:一家做了 26 年 IDE 订阅生意的公司,公开把"不排他"作为卖点——这句话的意思是,JetBrains 对在 Agent 能力层(Claude / GPT 谁更强)这一层没有必胜把握,但认定自己在"谁看得见、谁批得准、凌晨三点谁被叫起来"这一层有位置。ACP 若能长到 LSP 的位置,模型混战里 JetBrains 始终有把椅子:无论最后哪家模型赢,连接、上下文与治理都要从它这里过。对国内团队,IntelliJ IDEA / PyCharm 在 Java 后端、金融、政企的存量很厚,国产 Agent 想要进这些开发者的编辑器,过去只有两条路——为每家 IDE 各写一套插件,或者等 IDE 厂商适配——ACP 把这件事压成一次实现:协议实现对了,就能被任何支持 ACP 的编辑器拉起来,反过来也一样。这一周同时发生的"Opus 5.5 + GPT-6 Sol 同日对决"和"JetBrains Air 把多 Agent 拉进治理",是同一句话的两个不同侧面——AI Coding 进入"模型价格腰斩 + 协议层收口"的双轨分水岭。04 智元第 20000 台远征 A3 Ultra 入驻横琴长隆飞船乐园:300+ 台机器人 + 5G-A 专网 + 全球首个大规模具身主题乐园

9 月 24 日,智元(AGIBOT)第 20000 台通用具身智能机器人远征 A3 Ultra 在横琴长隆飞船乐园正式交付长隆集团,并将与其他智元机器人一起在园区常态化上岗,服务游客互动、导览、演艺及科普研学等场景。同一天,由智元与长隆集团联手打造的全球首个大规模具身智能主题乐园在横琴长隆飞船乐园启幕,超 300 台智元全系机器人、100+ 个交互体验点、覆盖 7 大核心文旅场景(演艺 / 导览 / 教育 / 酒店 / 零售 / 运动比赛 / 餐饮),常态化部署。智元与长隆同步揭牌"具身智能文旅联合研究院",围绕人形机器人场景适配、算法迭代、内容创作与商用验证开展联合研究。

A3 Ultra 的硬件参数:身高 174 cm,镁合金 + 碳纤尼龙机身,700 TOPS 算力(Jetson Thor 同档),20 自由度全向触觉灵巧手。续航约 10 小时,可覆盖乐园全日运营;具备 360° 全向感知与机械臂柔顺控制,"有人突然进入运动范围立即停下、与人接触时根据外力调整动作和力度"。智元合伙人 / 高级副总裁 / 通用业务部总裁王闯在采访中点出文旅场景的特殊难点:声音采集、降噪、多人识别、唇形识别在背景音乐 + 人群交谈 + 设备噪音下需要专门算法优化。

智元自研的 硅光动语 WITA 大模型把多模态感知、语音交互与动作执行联动起来,让机器人"能理解真实场景中的人和事";灵心平台(LinkSoul)在音色、表情、人设、动作、服装造型五个维度定制机器人,让长隆的 IP 角色贯穿外观与言行。底层是智元的 "三智一体"全栈架构——运动智能(执行器)、交互智能(情绪价值入口)、作业智能(劳动价值引擎)三件事与本体深度耦合。

真正把这件事推到产业事件级别的,是 5G-A 专网 + 多机协同。智元、长隆、中国移动联合共研"5G 切片边缘设备本地部署安全隔离"——把游客流量与机器人业务物理隔离,划分机器人专属 5G 局域网与可控 5G 互联网两张逻辑网络,实现极低端到端时延,让多模态交互"瞬间响应"、集群控制"海量同步"。配套的两项"全球首创":全球首个具身智能文旅景区运营运维一站式管理平台(让机器人服务从"部署上线"走向"长期可运营");全球首个具身智能文旅景区常态化部署安全方案(覆盖空间 / 人身 / 充电消防 / AI / 数据 / 运营六大维度)。

量产节奏:原型 6 → 2025.01 千台 → 2025 年底 5000 → 2026.03 万台 → 2026.06 15000 → 2026.09.24 20000——万台到两万台仅约 6 个月,且9/24 之前不久的 15000 台已交付龙旗产线服务工业制造场景。智元给自己定位是"全球出货数量最多、收入规模最大、发展速度最快的具身智能企业",把 2026 定义为"具身智能部署态元年"——竞争的核心从"技术能不能做到"切换到"场景能不能稳住"。

为什么值得关注:把具身智能从"研发验证和单点展示"推到"批量生产、规模交付和常态化运营",关键不在机器人本体,而在于有没有"标准化连锁母体"。长隆给出了第一个答案:横琴长隆飞船乐园空间复杂、日均客流庞大、开放度高,且具备完整的 IP 角色体系——这是天然的具身智能"试点园区",可以让 300+ 台机器人在同一个调度网络、同一套 IP 内容、同一组游客反馈下持续运转。当机器人真正成为乐园里"游客愿意反复靠近的伙伴",具身智能的商业化叙事才真正翻开第一页。对其他想走类似路线的厂商来说,9/24 之后的世界变成两组问题:一是能否复制类似的"标准化连锁母体"(主题乐园 / 大型商超 / 连锁餐饮 / 城市公共场所),二是能否把"5G-A 专网 + 多机协同 + 安全隔离"这套通信和治理架构下放到其他场景。具身智能的下半场,硬件量产只是入场券,"母体 + 调度 + 安全"三件套才是分水岭。

05 理想 MachEmbodied 连发四件套:ME-Brain-1.0 / ME-U0 / ME-VLM / ME-Dex-1.0,触觉入模 + 分层开源 + 端侧部署

9 月 21-22 日,理想 MachEmbodied 集中公开 5 个 GitHub 仓库(ME-Brain-1.0 / ME-VLM / ME-U0 / Focus-VLWA / ME-Dex-1.0)+ 4 篇技术报告,理想把它归为"汽车智能化能力外延到机器人具身智能"这条技术连续性的最新一站。ME-Dex 1.0 的 arXiv 版本 9/21 更新,9/22 当天其余四个仓库同步公开。官方把这条路线划成三层:短期由 ME-Brain 和 ME-VLM 面向可运行系统闭环与端侧部署;中期由 ME-U0 探索可继续扩展的统一预训练基座;更长期由 ME-Dex 推进力触感知与灵巧操作——三层分别对应"先让机器人跑起来、把分散能力统一起来、走向细腻物理交互"三个不同问题。

ME-Dex 1.0 把"未来触觉"纳入 World Action Model。传统的视觉-动作模型只看当前画面 + 任务指令 + 本体状态,World Action Model(WAM)进一步预测"动作执行后可能出现的未来视觉状态";ME-Dex 的变化是:未来状态里不只有视频,还包括未来触觉。架构上把视频、触觉、动作分别交给 Video Expert / Tactile Expert / Action Expert,通过 H-Bridge 共享注意力让它们交换信息。统一触觉自编码器把不同机器人本体(夹爪两侧 / 五指灵巧手指尖 / 掌面等)的触觉信号映射到类似人手的统一区域模板,让模型尽量理解不同传感器读数背后的物理含义。

ME-Dex 自报数据:RoboTwin 50 个任务(27,500 条 Clean + Random 轨迹训练)上 Clean / Random 成功率 91.56% / 91.92%,Fast-WAM 89.22% / 89.22%;DexJoCo 11 项任务平均 65.3%(vs DECO 56.4%、DECO.p 57.8%)、5 项双手任务平均 48.8%(两对照均为 39.6%);ManiFeel 4 项插拔 / 装配任务平均 70.0%(vs 基线 55.0%、高 15 个百分点)、Power Plug Insertion 58% → 88%。消融实验中:Random 成功率从仅建模视频和动作时的 86.90%,依次升至加入当前触觉后的 89.54%、预测未来触觉后的 90.60%、加入 H-Bridge 后的 91.92——每多一个模块都有增益,但"加触觉"不一定有效:同表中 π0.5 加触觉后反而下降。

ME-VLM 是 ME-Brain-1.0 的 Cognitive Core 路径,35B-A3B MoE + 4B 端侧变体;端侧部署在理想自研 SoC M100上,通过基座模型 Token 压缩(W4A8 量化 + 视觉 token 压缩)把 Prefill 阶段参与后续计算的 Token 从 4096 降到 3328,Prefill 时延从 400ms 降到 188ms(约 2.13× 加速)。ME-U0 用约 4200 小时筛选自更大机器人 + 第一人称数据池做预训练,自报 标准 LIBERO 平均 99.1%、LIBERO-Plus 无专门适配 81.8%、RoboDojo-Sim process score 17.66(多家 WAM 模型参与评测),并强调"预训练权重无需针对具体部署任务额外后训练,即可直接运行在预训练数据所涵盖的机器人平台上"——例如拿起记号笔、把纸巾放入盒子、移动数字 20 完成算式 3+17=20 三项代表性任务。ME-Brain-1.0 把 Evolvable Memory + Cognitive Core + 事件驱动的 Action Model 耦合成"执行 → 经验捕获 → 技能更新"闭环,跑在 M100 边缘 SoC 上做端侧记忆生成与检索。

开放程度并不一致——理想 GitHub 组织页给了 5 个仓库、代码 / 报告 / 运行时和部分权重都已公开,但:ME-U0 提供训练后处理和评测代码,但权重 / 数据集 / 仿真资产没随仓库提供;Focus-VLWA 提供训练后处理、数据处理和本地推理代码,运行仍需检查点与基础资产;ME-Brain 公开了框架与行动模型代码入口,行动模型权重、认知核心、与仿真和真实机器人的集成仍列在 Todo;ME-VLM 把推理代码、训练代码、预训练权重和端侧部署工具列为后续事项;只有 ME-Dex 已经公开推理运行时和 policy + tactile autoencoder 权重(HuggingFace: liuxuetao/ME-Dex-1.0-RoboTwin-Clean2Random-Leaderboard),但训练代码和数据仍标注为后续发布。第三方对 demo 视频的复盘(Robot Forward 报道由 Phoenix Tech 转载)提示:即便脚本化场景顺利,仍可见夹爪暂停、偶发误抓、未完成开放式任务——实验台账上的领先,并不等于真机的稳定性。

为什么值得关注:把这件事和智元+长隆叠起来,本期具身主题是同一件事——"硬件量产常态化 + 模型分层开源 + 跨本体迁移"三件事必须同时跑。智元给出硬件那一侧的答案(300+ 台量产 + 标准化连锁母体);理想给出模型那一侧的答案(5 个仓库、不同开放层级、把触觉从传感器问题推回到世界动作模型)。但真正值得关注的,是理想 GitHub 组织页面上这 5 个仓库的开放程度并不一致——ME-Dex 公开权重,ME-U0 没权重;ME-VLM 推理权重列为后续事项;ME-Brain 还在补。这种"按项目分级、按模块分批"的开放节奏,意味着车企做机器人的真正起点不是"我有一个模型",而是"我能持续把资产按节奏释放"。下一阶段具身赛道要看三件事:ME-Dex 训练代码与数据是否继续公开、ME-U0 权重与数据集是否到位、ME-VLM 端侧部署是否在更多本体上验证——这三条到位之后,"车企外推到机器人"这条路线才能从论文走向系统。观察:五条新闻,三道分水岭

• AI Coding 走进"价格腰斩 + 协议层收口"分水岭:Opus 5.5 用 $4/$20 + 缓存读 $0.20 抢 Fable 份额(SWE-bench Pro 89.9%、Fable 级护栏下放)、GPT-6 Sol/Luna 同日用 $2/$10 与 $0.10/$0.50 把编码价格腰斩且编码欺骗率 10.4%→1.3%、JetBrains Air 把 IDE 从单一 Agent 工作台扩展为三层治理平台并把 ACP 推向 25 个 Agent 注册中心——三件事叠在一起,结论是同一个:AI Coding 的下一战场不再是"谁家模型分高",而是"谁家把多家 Agent、多套协议、多层治理拉到同一张工程网"。下半场拿到入场券的,是"价格 / 协议 / 治理"三件套同时跑通的玩家。

• 具身智能走进"硬件量产常态化 + 模型分层开源"分水岭:智元 20000 台 A3 Ultra 入驻长隆(300+ 台常态化上岗 + 5G-A 专网 + 三智一体架构)、理想 MachEmbodied 5 个 GitHub 仓库 + 4 篇技术报告(ME-Dex 把未来触觉纳入 WAM、ME-VLM 端侧 M100 Prefill 188ms、ME-U0 4200h 预训练)——两件事叠在一起,结论也是同一个:具身智能的下半场比拼的不再是 demo 漂亮,而是"硬件量产 + 场景常态 + 模型分层开源"三件事同时跑通。硬件量产的多形态铺开与通用大脑的分层开源,是 2026 下半年具身最确定的双轴。

把这两条主线叠起来,本期共同的信号其实是同一件事——AI 不再是 demo,比拼的是"被衡量得多准、被开放得多深、被连接得多广"。Opus 5.5 写的是"护栏下放 + 缓存读 -60%",GPT-6 Sol 写的是"价格腰斩 + 欺骗率 -90%",JetBrains Air 写的是"协议层收口 + 多厂商治理";智元 + 长隆写的是"硬件量产常态化 + 标准化连锁母体",理想 MachEmbodied 写的是"模型分层开源 + 触觉入模"。五件事拼在一起,考核标准已经从 demo 切换到了工程答卷——能不能交出"价格 / 协议 / 治理 / 量产 / 开源"这张卷子,决定下一轮估值的锚点位置。

一个明确的观点:判断一个 AI 玩家是否进入"基础设施"层,看的不是它当下的模型有多强,而是它的标准有多开放、协议有多通行、量产有多稳。AI Coding 这一侧,Opus 5.5 与 GPT-6 Sol/Luna 同日对决意味着 AI 旗舰模型进入"价格 + 欺骗率"双向透明可比阶段——以前要靠自家 PPT 证明自家强,现在同价位档同档 SWE-bench 同周发布的对手就在眼前;JetBrains Air + ACP 协议意味着"多 Agent 协同"开始走"开放协议 + 治理层"路线——以前每家 IDE 厂商各写一套插件,现在 ACP Registry 把 25 个 Agent 一次性拉到同一张连接网。具身这一侧,智元 2 万台 + 长隆 300+ 台常态化上岗 + 5G-A 专网意味着具身智能开始走"标准化连锁母体 + 持续运营"路线——以前 demo 跑一次就结束,现在 7 大场景、100+ 交互点、机器人专属 5G 局域网 + 6 维安全方案支撑全天运营;理想 MachEmbodied 5 个仓库不同开放层级意味着车企外推具身开始走"模型分层开源 + 触觉入模"路线——以前 demo 视频 + PPT,现在 ME-Dex 已经公开 policy 与 tactile autoencoder 权重、其余 4 仓按节奏分批释放。当开放变成标准、协议变成连接、量产变成入场券,这个赛道就从"模型比拼"升级为"生态耐力赛"。本期这五条新闻,押注的都是同一句话——下一波真正的赢家,不是当下最强的,而是"标准最开放 + 协议最通行 + 量产最稳"的那一拨。

留给关心下一周的人:Opus 5.5 自报 SWE-bench Pro 89.9% / Terminal-Bench 4.0 66.4%,但终端用户基准尚未第三方独立验证,下一次 Artificial Analysis 智能指数与 long-context 评测更新是关键;GPT-6 Sol 自报 Coding Agent Index 57 分 vs Luna 41 分,Luna 在 max effort 仍是编码专项弱一档——选 Sol 还是 Luna 取决于任务是否容忍"更保守拒答换更高诚实度";JetBrains Air Teams 与 Air Governance 仍在 early access 且无 Windows 发布时间,企业评估可以等首批 6 个月落地数据;ACP Registry 当前 25 个 Agent 但真正生产可用的只有一半左右,下半年 agent 增量曲线决定 ACP 能否走到 LSP 位置;智元 2 万台交付长隆后,下一阶段量产节奏与"具身文旅联合研究院"第一份对外成果是关键观察点;理想 MachEmbodied ME-U0 权重 + 数据集、ME-VLM 推理与端侧部署、ME-Brain 行动模型权重这三件事到位节奏决定其从"论文级开源"切换到"系统级开源"的时间点。2026 下半年的三个基础设施时刻,我们明天继续观察。

每日 AI 动态,我们明天见。

OCR:IMG:1 > 2 > 2 > <> YI E E

OCR:IMG:口 中容 山 汇 公众号·火种AI共创社

本栏目中的所有页面均系自动生成,自动分类排列,采用联索网络信息采集、网页信息提取、语义计算等智能搜索技术。内容源于公开的媒体报道,包括但不限于新闻网站、电子报刊、行业门户、客户网站等。使用本栏目前必读