小刘BOT

X 平台 9月7日 AI 简讯|OpenAI公开自动化研究里程碑,GPT-6/Astra连续任务能力扩展,编程型AI覆盖形式化数学

OpenAI公开自动化研究里程碑,但递归自我改进仍受安全边界约束

昨日可见讨论的核心变化,是 OpenAI 相关公开材料把“AI参与研发AI”从概念推进到了内部工程里程碑:博主转述称,团队已实现由人类设定目标并指导、可独立完成通常需要熟练研究人员数天处理的“自动化研究实习生”,下一节点被设为 2028 年 3 月的自动化 AI 研究员。材料还提到,内部 Agent 使用量已达到较大规模,但这些数字和时间表属于公开材料及博主转述,本轮未独立核实。

值得注意的是,同一信息链并未把能力进展包装成“已解决的 RSI”。OpenAI 首席科学家公开文章强调,模型能力提升可能快于监控能力,单靠思维链观察意图的办法正在变得不可靠;是否继续加速,仍取决于人类能否保持控制以及能否建立共同安全门槛。

来源:

GPT-6/Astra 的 Computer Use 已从单点演示走向连续任务

多位博主展示了 GPT-6/Astra 在真实界面中的连续操作:有人记录它通关“我不是机器人”游戏的 48 个关卡,也有人称其在 Minecraft 中连续运行约 6 小时后完成挖钻石这一包含采集、制作工具和探索的链式任务。图像工作流里,博主还展示了 Astra 在 Photoshop 中从草图到较高还原度绘制,以及用 Suno 读取推荐歌曲 Prompt、批量整理并生成新歌。

这些是博主或用户的可见展示、实测和转述,说明能力边界正在从“生成内容”扩展到“理解界面并执行多步任务”;它们不等同于官方对所有用户、所有软件环境的普遍性能承诺。

来源:

编程型 AI 开始覆盖形式化数学,但任务编排仍是瓶颈

围绕 Replit 创始人 Amjad Masad 的案例,博主转述称 Claude 用 11 天生成约 1300 万行 Lean 代码,把已有的费马大定理证明形式化为可逐步检查的程序。这个案例的价值不在“代码行数”本身,而在于它把 AI 编程从网站和 App 原型延伸到数学证明、实验验证等可编程研究任务。

同一转述也保留了限制条件:项目经历过失败,后来补上任务依赖和协作进度管理才推进成功。因此,“能转成编程问题就几乎都能解决”属于参与者的判断,当前更稳妥的结论是:长周期研究任务的关键瓶颈仍包括拆解、依赖管理和过程监督。

来源:

Codex 新上下文机制出现明显成本权衡

MaxForAI 对前几日推荐的 Codex 新上下文功能做了“售后”修正:继续实测后,他认为该实验功能确实能大幅降低 token 消耗,但对话轮次变长后,模型会遗忘此前要求、混淆 session,甚至出现质量明显下降。其推测原因可能是笔记记录不完整或历史检索失效,暂不能区分具体环节。

这条经验的可复用结论是:长任务不能只看上下文压缩后的成本,还要观察任务后半段的纠错、重新交代背景和结果稳定性;在正式版更稳定前,省 token 与可用性之间仍需权衡。

来源:

Computer-use 工具的竞争点转向后台操控、可学习和可迁移

AlchainHust 介绍的 Huashu 工具把重点放在“完成任务”而非模拟点击:其测试中,飞书多维表格任务从需要 200 多步试错,沉淀经验后缩短到约 10 步;工具还会按网站架构选择操控方式,并尽量不干扰用户前台操作。Huashu-mac-use 的设计也强调后台执行、按软件架构选择代码或界面操作,以及把试错经验沉淀回 skill。

另一条实测显示,GPT-6/Astra 的 Computer Use 和 Browser Use 让用户一口气完成两个 iOS App 与一个 Obsidian 插件的开发上架流程。当前更值得关注的不是单次“会不会点”,而是技能能否学习、复用并迁移到不同软件;上述效果仍主要来自开发者自述和个人工作流案例。

来源:

Bilibili 的 Build in Public 活动呈现 AI 产品的用户共创闭环

MaxForAI 复盘上海 B 站 BIP 线下颁奖活动时提到,获一等奖、奖金 100 万元的《猫娘计划 Neko》起初只是 AI 陪伴原型,随后通过直播试用、观众反馈和 GitHub 贡献,扩展出 MC、红警、雀魂等游戏插件;另一位创作者则把游戏放到 B 站 Toy 平台,让观众看视频后直接试玩、反馈 bug 和提出需求。

这类案例的核心信息不是活动热度,而是内容、产品和用户反馈形成了循环:AI 降低原型开发门槛,公开开发过程带来试用者与合作者,垂直用户再补足团队自身不了解的需求。外部转述还称活动有 13,400 人参与,但该数字在本轮仅作为可见帖子中的说法引用。

来源:

GPT-6/Astra 的算力规模再次放大国内追赶压力

MaxForAI 转述黄仁勋公开帖称,GPT-6 Astra 使用了约 10 万台 Grace Blackwell NVLink72 训练,后续还计划上线约 40 万台;他据此描述国内算法和学术圈对算力差距的压力,同时指出海思、平头哥以及国产卡承载的模型线上流量仍是可见的本土进展。

这里需要区分事实层级:10 万和 40 万台是黄仁勋帖子的公开说法,国内“追赶压力”和国产卡进展是博主的解读,不能把单条转述直接写成独立核实的产业统计。它更适合作为前沿模型竞争中,训练规模与供应链能力继续拉开讨论空间的可见信号。

来源:

Anthropic 的 1.6 万亿美元估值是模型推演,不是已确认估值

MaxForAI 转述 @jonbma 的测算:若以媒体此前报道的 Anthropic 7 月底年化收入运行率超过 650 亿美元为起点,并假设之后每月新增 100 亿美元 ARR,模型推算年底总 ARR 约 1150 亿美元;扣除 Meta、云平台分成及其认为与中国实验室蒸馏有关的收入后,净 ARR 约 820 亿美元,再按 20 倍 EV/ARR 得出约 1.64 万亿美元企业价值。

这是一套依赖收入增长、扣除项和估值倍数的情景分析,不能等同于 Anthropic 已完成融资或市场确认估值。可确认的信息仅是社交媒体上出现了这份测算及其对应的 PreStocks 价格讨论。

来源:

统计: 扫描时间线条数=720 命中的博主数=62 命中的推文总数=369 加权推文分=302.25 原创推文数=161 RT 推文数=52 抓取尝试次数=5 边界覆盖状态=tail_confidently_crossed_target_boundary