Claude Code Projects 把多智能体协作放进单一项目对话
Anthropic 正在灰度发布 Claude Code 的 Projects:用户只需在一个主对话交代目标,Claude 会把任务拆成多个并行 Thread,在云端独立运行、共享项目记忆,并在电脑离线后继续工作。每个 Thread 都有自己的代码副本和分支,可跑测试、开 PR,项目还会把需要用户决策的事项集中展示。
这意味着项目从“存资料的文件夹”变成了持续运转的工作大厅。官方当前说明是,功能先面向部分 Pro/Max 用户的云端会话,Thread 暂时不能访问本机文件、工具和内网;Boris Cherny 则表示自己已经不再手动管理会话,直接把想法交给项目拆分执行。
来源:
- @claudeai: https://x.com/claudeai/status/2100632677904744716
- @claudeai: https://x.com/claudeai/status/2100632687316730327
- @bcherny: https://x.com/bcherny/status/2100669598995816511
Qwen3.8-Omni-Flash 将音视频理解、推理和工具调用合成 Agent 流程
Qwen 官方发布 Qwen3.8-Omni-Flash,定位是面向 Agent 的全模态模型:可同时理解音频和视频、规划任务、调用工具,并覆盖视频剪辑、短视频翻译和电影摘要等流程。官方给出的能力描述包括 100 万 token 上下文、音视频 Agent 评测平均提升 19.5 分,以及相较 Qwen3.5-Omni-Plus 约 89% 的视频输入成本下降。
配套动作也很明确:Qwen 同步开放 Qwen-MM-Plugins,并准备 Qwen-Live Harness。博主 @LufzzLiz 进一步梳理称,普通版原生输出文本,实时语音需要 Realtime 版,成片、配音和 PDF 仍由配套工具完成;因此目前更像“模型加工具链”的可用方案,而非单模型包办全部产出。
来源:
- @Alibaba_Qwen: https://x.com/Alibaba_Qwen/status/2100785962414702599
- @LufzzLiz: https://x.com/LufzzLiz/status/2100958474188546313
OpenAI 把 GPT-6 Astra 推进法律工作流和行业插件生态
OpenAI 宣布 Astra for Law,称其由 GPT-6 Astra 驱动,并配有面向法律实践的工具、设置和上下文。首阶段将通过 ChatGPT 和 Codex 的 Trusted Access 向选定律所提供,API 访问随后开放;OpenAI 表示会维护法律配置,让开发者专注于自己的产品与流程。
这次发布同时带来 26 个合作方插件和 47 个社区插件,合作方包括 Thomson Reuters、Harvey、Legora 和 iManage。可见重点不只是模型能力展示,而是把专业知识、既有工具和律师自定义技能接到同一工作环境中;正式可用范围仍以选定机构和后续 API 开放为准。
来源:
- @OpenAI: https://x.com/OpenAI/status/2100679992720142459
- @OpenAI: https://x.com/OpenAI/status/2100679997862330735
- @OpenAI: https://x.com/OpenAI/status/2100680000072773702
Figure Helix 2.5 把人形机器人的泛化测试推进到陌生家庭
Figure 发布 Helix 2.5 后,把搭载模型的机器人送进旧金山湾区 30 个此前没有采集数据的真实家庭,测试收拾客厅玩具、折叠毛巾和铺床三项长程任务。博主转述的综合单次试验成功率为 56%,并特别指出机器人遇到失误或受限时能重新调整站姿、换角度或绕行后继续执行。
这组演示的价值在于测试条件包含陌生环境、未做现场微调和多步骤动作,关注点从单个动作是否完成转向失败后的自我纠错。现有材料是 Figure 的发布信息与两位博主的整理,56% 属于可见报道中的测试结果,不应外推为通用家务能力。
来源:
- @xiaohu: https://x.com/xiaohu/status/2100777129772450082
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2100917239348445651
ZCode 源码上传争议推动本地 Agent 透明度成为产品底线
社区对 ZCode 的可见取证称,客户端可能在登录或索引过程中打包工作区及完整 Git 历史并上传到阿里云 OSS;争议集中在默认行为、用户知情权、开关和密钥控制。随后 @MaxForAI 转述智谱说明:问题与“代码库索引”中的 Repo Wiki 触发云端生成有关,上传数据会在生成后销毁,相关问题已修复,并计划开源代码、接受第三方审查及为用户重置一次周额度。
目前应把两层证据分开:上传行为来自社区取证与转述,修复原因和后续措施来自被转述的官方回应;在没有更多独立审计材料前,不能把“数据已销毁”等回应当成外部验证结论。这一事件直接影响开发者对本地 Agent 的信任,也使默认上传、隐私说明和可关闭性成为选型检查项。
来源:
- @xiaohu: https://x.com/xiaohu/status/2100933215146176668
- @MaxForAI: https://x.com/MaxForAI/status/2100889770255843470
- @ferstar_org: https://x.com/ferstar_org/status/2100805861002355154
“验证者定律”解释 AI 为何先攻克可测量的数字任务
@dotey 转述 Jason Wei 在 Stanford AI Club 演讲中的一套判断框架:AI 能力会在达到前沿后迅速商品化,推理成本持续下降;任务越容易客观、快速、大规模验证,越适合用模型生成候选方案再自动筛选。AlphaEvolve 被作为例子:模型产生大量候选解,验证器评分,再把优解用于下一轮。
这套框架还强调 AI 能力呈“锯齿状”而非整体同步提升:竞赛数学和部分编程已接近高点,化学、物理世界任务和数据稀缺领域则更慢。它更适合作为判断自动化顺序的分析框架,不是对具体年份或行业结果的确认预测。
来源:
Vibe Coding 的关键从读代码转向拆分、验收与可回滚
@dotey 的实践建议是,非工程师不必把代码整洁度或内部推理当成主要验收标准,而应像 QA 一样检查功能完整性、性能和安全;任务要拆成 Agent 能稳定处理的小模块,再通过测试、运行表现和安全检查验收。其后续补充也承认,验收只能覆盖预先想到的场景,涉及钱、数据和安全的关键路径仍应请专业人员把关。
这与“AI 写完就直接上线”不同:核心是把实现细节交给模型,把可观察结果、边界条件和回滚能力留在人手中。@imwsl90 的独立实践也显示,AI coding 更适合快速验证产品和修补已发现的问题,但不能替代对支付漏洞等关键路径的检查。
来源:
- @dotey: https://x.com/dotey/status/2100767963737727267
- @dotey: https://x.com/dotey/status/2100971776977051862
- @imwsl90: https://x.com/imwsl90/status/2100810904309010491
OpenAI 开发者工具把上下文接入和用量可视化做成桌面体验
OpenAI Developers 展示了 Windows 上的 Appshots:用户可以把正在使用的应用上下文交给 ChatGPT,用于调试、复刻界面或读取另一个应用的数据,减少反复复制粘贴;同时,桌面端新增用量分析入口,可查看任务、子 Agent 和单个对话对 Codex 用量的贡献。
这两项更新分别解决“让模型看见工作现场”和“知道额度花在哪里”两个问题,前者降低上下文搬运成本,后者帮助用户调整工作流。公开推文只说明了功能入口和典型用途,具体支持范围仍以客户端实际版本为准。
来源:
- @OpenAIDevs: https://x.com/OpenAIDevs/status/2100726653366534560
- @OpenAIDevs: https://x.com/OpenAIDevs/status/2100733366438150546
统计: 扫描时间线条数=554 命中的博主数=56 命中的推文总数=320 加权推文分=234.65 原创推文数=117 RT 推文数=88 抓取尝试次数=4 边界覆盖状态=tail_confidently_crossed_target_boundary