Claude Fable 5.1 把长任务能力、成本与企业隐私一起推向前台
Anthropic 发布 Claude Fable 5.1 与面向受邀研究者的 Mythos 5.1;这次升级的核心不只是跑分,而是让模型能更长时间自主执行复杂工作。官方与使用者信息显示,Fable 5.1 在 Terminal-Bench-Science 0.1 得分 52.6%,高于 Fable 5 的 24.7%;Terminal-Bench 4.0 为 55.8%,Mythos 5.1 为 60.9%,且模型曾在测试中连续自主运行 38 小时。
另一个直接影响实际使用的变化是 Cache Read 价格从每百万 Token 1 美元降至 0.25 美元,Anthropic 估算一般负载总成本约降 25%,高度 Agent 化负载最多降 45%。与此同时,企业版 EFS 计划让数据留在客户自有云中,并增加面向 Agent 风险模式的监测;但博主实测和讨论也指出,Fable 5.1 的订阅额度消耗可能很快,API 成本不能只看缓存单价。
来源:
- @claudeai: https://x.com/claudeai/status/2094848572143407483
- @dotey: https://x.com/dotey/status/2094854620732375335
- @alexalbert__: https://x.com/alexalbert__/status/2094889286990446769
Qwen3.8-Max-0902 以持续后训练刷新 Agent 编程竞争
阿里发布 Qwen3.8-Max-0902,底座仍是 2.4T 参数、1M 上下文,但继续针对 Coding 与 Cowork 后训练。官方给出的价格为输入每百万 Token 2 美元、输出 6 美元,显式缓存命中 0.17 美元、隐式缓存命中 0.25 美元;Code Arena WebDev 中,该版本以 1691 分暂列第一,超过上一版 22 分和 Claude Opus 5 Max 3 分。
博主对同一系列的对比还显示,TerminalBench 从 11.3 提升到 29.0,DeepSWE 从 56.6 提升到 69.3,QwenSWEBench V2 达到 70.0。这个案例的价值在于:前沿模型不再只按“大版本”迭代,发布后的数据、强化学习和 Agent 环境训练,正在成为持续拉开差距的主要环节。
来源:
- @Alibaba_Qwen: https://x.com/Alibaba_Qwen/status/2094968708288680276
- @LufzzLiz: https://x.com/LufzzLiz/status/2095085997214384624
- @cellinlab: https://x.com/cellinlab/status/2095007265086668957
Gemini API 的 Agentic Video 让长视频检索从“逐帧扫描”转向自适应取证
Google 在 Gemini API 引入 Agentic Video:模型可以根据问题自主决定何时快进、慢放或回看,并选择重点听音频、读字幕或检查画面,而不是对长视频等间隔截帧。Google 相关负责人称,这种处理方式最高可减少 88% 的 Token 消耗,同时提高结果质量。
可见应用包括定位镜头变化、搜索数小时视频中的具体事件、对关键时间窗口进行高帧率异常检测,以及随时间追踪动作和物体数量。当前主要通过 API 使用,后续计划接入 YouTube 的 Ask YouTube;它对视频剪辑、长视频问答和视觉质检的实用意义,比单纯增加一个“看视频”入口更明确。
来源:
- @OfficialLoganK: https://x.com/OfficialLoganK/status/2094843143623680264
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2095011424020128059
World Labs Atlas 把视频生成推进到可控的三维世界重建
World Labs 发布 Atlas,官方称其为从零训练的多模态世界模型。它把文本、图像、视频、相机位姿和 3D 深度放进统一的空间上下文,可从一张或多张图像重建场景,并按指定位置、角度和运动轨迹生成最长 1 分钟、1440p 的视频与新视角。
独立体验和项目方材料显示,Atlas 还能把少量手机照片转换为点云或 3D Gaussian Splat,并用几部手机拍摄的动态视频重现“子弹时间”;在机器人方向,它可为虚拟环境生成 RGB 和深度数据,用于训练和测试。当前仍是少数合作伙伴 Early Access,价值主要在于把影视机位控制、空间重建和机器人仿真放进同一模型框架。
来源:
- @theworldlabs: https://x.com/theworldlabs/status/2094839756329041984
- @drfeifei: https://x.com/drfeifei/status/2094840371675283673
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2095093766327795718
OpenAI 将 Astra 的网络安全能力推到 Critical,同时把可监控性列为约束
OpenAI 在发布预告中确认,Astra 按 Preparedness Framework 已达到网络安全能力的 Critical 阈值,并表示曾延后部分开发以强化隔离、网络权限和监控。Sam Altman 的公开说明也强调,Astra 已完成训练,但后续模型会在安全与对齐工作足够时再推进。
围绕 Astra 的可见讨论集中在两条张力上:一方面,报道转述其可用更深的内部循环增加推理计算,却可能让更多思考留在隐藏状态;另一方面,OpenAI 首席科学家回应称当前前沿模型的计算图深度仍在 GPT-4 的约两倍以内,并明确承认 Chain-of-Thought 可监控性脆弱且正在恶化。可确认的是,安全能力与监控能力已同时成为发布门槛,不能只用单一跑分评价这次升级。
来源:
- @OpenAI: https://x.com/OpenAI/status/2094885578173260259
- @sama: https://x.com/sama/status/2094934592062959832
- @MaxForAI: https://x.com/MaxForAI/status/2095048557430727063
- @derrickcchoi: https://x.com/derrickcchoi/status/2094954736470614151
Uber 的软件工厂案例显示,Agent 正从个人助手进入完整研发流水线
一位博主整理的 Uber 工程团队分享显示,2026 年 2 月至 8 月中旬,Uber 内部 Agent 产品周活增长 7 倍、周请求量增长 9.4 倍,但单次会话成本较峰值下降 52%;超过 70% 的 Pull Request 被归因于本地或云端 Agent,每天执行的开发类 Skill 超过 3 万次。
这套体系覆盖代码评审、CI 自愈、端到端视觉验证、告警分诊、Bug 调试和维护,并由统一模型网关管理身份、隐私、预算与审计,再以 MCP 网关、隔离开发环境、Skill 市场和 Context Graph 串起流程。它提供的关键经验不是“给员工一个聊天机器人”,而是把 Agent 嵌入可审计、可复用、有人接管的生产系统。
来源:
WorkBuddy 开放平台开始争夺跨设备 Agent 的身份与权限层
腾讯在 9 月 2 日上线 WorkBuddy 开放平台,博主转述的首批信息包括 100 多家合作伙伴、9 款联名硬件和 30 多个行业应用,并开放 Buddy 应用、Expert、Skill、Connector 及硬件接入。眼镜、录音卡、耳机、键鼠等设备负责采集和触发,WorkBuddy 负责理解、规划、调用工具与执行。
公开的接口说明还显示,第三方应用在获授权后可创建、读取云任务,也能向本地电脑助理发消息并读取在线状态和历史消息。平台争夺的因此不只是一个办公入口,而是身份、权限、记忆、任务状态与分发;后续仍需观察跨设备任务成功率、伙伴留存、开发者收入和权限事故率,生态规模尚不能仅凭首批接入数确认。
来源:
中国 AI 治理继续从内容处置上游延伸到模型与 Agent 应用
博主转述中央网信办公布的“清朗·整治 AI 应用乱象”第二阶段进展称,相关行动累计清理违法违规信息 561 万余条、查处账号 4.9 万余个,并处置违规网站和应用程序 2400 余个。可见治理对象覆盖 AI 魔改和虚假灾害信息、换脸换声冒充、低俗暴力内容、未成年人相关违规内容,以及 AI 托管账号和网络水军。
同一信息还提到,豆包、元宝、千问、文心一言等平台被要求强化原始语料审核、违规输出限制和生成内容标识;社交平台升级多模态审核、人脸与声纹库,手机厂商和应用商店加强 AI App 审核抽检。按这条公开转述,治理链条已从“发出后删除”扩展到训练语料、模型输出、Agent 行为与应用分发,但具体执行效果仍应以官方后续披露为准。
来源:
统计: 扫描时间线条数=600 命中的博主数=66 命中的推文总数=405 加权推文分=297.75 原创推文数=150 RT 推文数=108 抓取尝试次数=4 边界覆盖状态=tail_confidently_crossed_target_boundary