Codex 会话历史丢失被多账号反馈为索引或投影异常
昨日可见的多条社媒反馈集中指向 Codex 长会话历史异常,值得关注之处是“内容似乎未被删除”与“工作上下文无法正常加载”可能是两件事。MaxForAI 描述 Mac、Windows 用户出现历史回退、消失后重现和客户端闪退,并补充 GitHub issue #38792:长 Session resume 后只剩最初一轮,原始 rollout 仍在,重建 thread_history projection 曾恢复一个 110MB 的两天 Session。aiwarts、paji_a 也分别称自己遇到十几轮记录消失或整晚 goal 工作丢失。现有材料属于博主反馈和问题线索,未显示官方故障确认;重要进度应及时 commit,不要只留在 Session 中。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2092064128630464836
- @MaxForAI: https://x.com/MaxForAI/status/2092069171903557969
- @aiwarts: https://x.com/aiwarts/status/2092132131950735551
- @paji_a: https://x.com/paji_a/status/2092084877130879239
OpenAI 宣布恢复 Plus 的 5 小时使用窗口,Pro 暂不启用
OpenAI 产品负责人 Tibo 直接宣布,ChatGPT Work 和 Codex 的 Plus 账户将恢复 5 小时限制;他给出的原因是平滑计算负载,并避免相对轻度或新用户不慎耗尽整周额度后产生困惑。公告同时说明,Pro 100 美元和 Pro 200 美元订阅在未来几个月暂不启用该限制。这个变化是明确的官方产品规则调整,影响主要落在 Plus 用户的连续编码和长任务安排上。
来源:
- @thsottiaux: https://x.com/thsottiaux/status/2092058556707344708
- @op7418: https://x.com/op7418/status/2092092710064963769
Tibo 设想的下一代 Agent 将隐藏 Skills、Memory 与 Sub-agents
围绕 Tibo 访谈的两则整理都把重点放在 Agent 形态变化:高级用户今天需要自己维护 skill files、memory 和 sub-agent 网络,理想状态则是 Agent 深度理解个人目标和团队上下文,主动推进任务而不暴露这些底层复杂度。访谈整理还区分了面向个人协作的 personal AGI 与面向生产系统的 full automation,并认为未来瓶颈可能从人的操作速度转向电脑和计算资源;ChatGPT 与 Codex 被描述为可能汇聚到同一套 personal AGI 底座。以上是博主对访谈的转述,不等同于已发布产品路线图。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2092010119597056425
- @aiwarts: https://x.com/aiwarts/status/2092132131950735551
豆包工作上线,办公 Agent 竞争转向组织上下文
多位博主报道并体验了字节的新产品“豆包工作”。可见描述显示,它被定位为独立的办公 Agent 工作台,能力覆盖文档、表格、PPT、网页和应用生成,以及浏览器、Computer Use、MCP 连接器和云电脑协同;与飞书结合后,可以利用群聊、会议纪要、文档、日历和组织权限等上下文。观察者因此把差异点归结为“Agent 进入组织现场”,而不只是个人聊天或局部提效。产品能力和体验判断来自博主整理,材料中没有独立的官方性能评测。
来源:
- @dotey: https://x.com/dotey/status/2092250134243369035
- @op7418: https://x.com/op7418/status/2092215065189708157
- @AlchainHust: https://x.com/AlchainHust/status/2092117722125455372
Agent 搜索基础设施开始进入价格战
昨日一则对 Search Fast API 的整理,把 Agent 成本结构的变化说得很具体:Parallel 方面的可见信息称,搜索价格压到每 1000 个结果 1 美元、平均延迟约 700ms;在其完整任务测试中,搜索成本占比可从不到 12%到其他服务的约 48%至 68%,并据此给出 2.2 至 2.79 倍的任务成本下降。与此同时,整理引用的模型成本数据显示,达到一定能力门槛的推理成本近几个月下降 8.5 倍或 12.5 倍。若这些口径成立,Agent 账单的竞争重点会从 Token 单价扩展到 Search、Browser、Context、Memory 和 Sandbox 等外围服务;这些是转引的厂商和评测数据,不是本轮独立复核结果。
来源:
Claude 同时补齐长输出渲染与企业 MCP 权限基础设施
Anthropic 的两项更新分别解决了 Agent 使用中的前端和治理问题。ClaudeDevs 称,网页与桌面端重做 streaming renderer 后,长回答流式体验约顺滑 4 倍,较慢笔记本卡顿减少约 9 倍,120Hz MacBook 可保持 120fps;这不是模型生成更快,而是只更新仍在变化的内容。另一项更新让 Team 和 Enterprise 管理员通过身份提供商集中管理 MCP Connector 授权。两者共同说明,长任务的可用性不仅取决于模型推理,也取决于渲染、身份、权限和审计等产品基础设施。
来源:
- @ClaudeDevs: https://x.com/ClaudeDevs/status/2092006814804214163
- @ClaudeDevs: https://x.com/ClaudeDevs/status/2091953609185657251
- @MaxForAI: https://x.com/MaxForAI/status/2092019982398005299
- @MaxForAI: https://x.com/MaxForAI/status/2091994994412540202
中国开源模型成为对齐研究常用底座,实用差距正在收窄
两则分析提供了一个需要区分“绝对能力”和“实际可用性”的信号。dongxi_nlp 转述对 221 个 MATS alignment and safety 项目的分析称,2026 年使用明确模型的项目中,72% 使用中国开源权重家族、54% 使用美国家族,Qwen、Llama、DeepSeek 的出现率分别为 66%、44%、32%,闭源模型仍在约 90% 的项目中充当评审、监控或前沿基线。另一则整理引用 ECI 数据称,中国前沿模型绝对能力仍落后美国约 4 至 5 个月,但 GLM 5.1、Kimi K3 已进入部分 Coding 和 Agent 任务的“够用”区间。两者都只是社媒转述或分析,不能写成中国模型已全面追平。
来源:
- @dongxi_nlp: https://x.com/dongxi_nlp/status/2091933959969992775
- @MaxForAI: https://x.com/MaxForAI/status/2091994535908028614
NVIDIA 与 SpaceXAI 的 Agent 硬件路线延伸到轨道计算
可见的 NVIDIA 帖文称,SpaceX 正部署 Vera CPU,用于 Agentic AI 的编排、代码执行和数据处理,并与 NVIDIA 合作设计面向太空的 Vera Rubin NVL72 系统,计划在明年第四季度发射、2028 年扩大规模。这里的变化不只是新增一颗 CPU,而是把 Agent 工作负载中的调度、数据处理和 GPU 供给纳入整套基础设施;现有材料是 NVIDIA 帖文被 Elon Musk 转发、再被博主整理的公开信号,不能扩写为已经完成的轨道部署。
来源:
- @nvidia: https://x.com/nvidia/status/2091920680317046847
- @elonmusk: https://x.com/elonmusk/status/2091939113008238838
- @MaxForAI: https://x.com/MaxForAI/status/2091946415203450944
基隆地检据报起诉涉 130 台 B300 服务器的非法出口案
MaxForAI 转述基隆地方检察署 8 月 24 日公告称,案件涉及英伟达、美超微相关人员及经销、数据中心和贸易环节,检方指控涉案人员以虚假机房条件和材料通过审核,130 台 B300 服务器中已有 74 台完成转售或出口、56 台被拦截;案件共 9 人被起诉,相关人员被指获得约 2120 万美元利益。以上是单一博主对检方信息的转述,正文仅保留可见的起诉、数量和指控事实,不将其扩写成最终定罪结论。
来源:
统计: 扫描时间线条数=480 命中的博主数=49 命中的推文总数=307 加权推文分=254.2 原创推文数=148 RT 推文数=44 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary