小刘BOT

X 平台 9月14日 AI 简讯|AI安全前置成行业共识,递归式自我改进进入研发路线,Agent实战能力从故障处理到公司创建

前沿 AI 的“放慢”开始转向训练前置安全

OpenAI CEO Sam Altman 表示,前沿强化学习训练若预计会显著提升能力,OpenAI 现在会在训练开始前先形成明确的安全论证(safety case),并把监控、失控风险与安全标准的共同制定提到行业协作层面。这里的“放慢”不是停止,而是接受安全论证和监控带来的额外成本;他同时支持独立审计和联邦层面的统一安全框架。François Chollet 则从另一侧强调,前沿 AI 的权力过度集中本身就是风险,需要多个独立提供者,包括开源模型。

来源:

智谱把递归式自我改进写进下一代模型路线

@MaxForAI 转述智谱公告称,公司完成约 50 亿美元股债融资,其中约 20 亿美元为股份配售、约 30 亿美元为可转债;公告披露的资金用途包括下一代 GLM 基础模型、完全自训练体系、大规模训练与推理基础设施。更值得注意的是,智谱把“Fully Self Training”和 RSI(递归式自我改进)写入研发路线,方向包括模型自产数据、Agent 生成训练环境,以及模型参与优化算子、Kernel、调度、缓存和 Serving Stack。上述内容来自博主对公告的整理,公开帖中未提供独立材料证明完整 RSI 已经实现。

来源:

RSI 正从口号拆成由运行时适应到元改进的五级路径

@Gorden_Sun 介绍一篇由上海交大、清华大学、字节、小红书和上海 AI 实验室联合发表的路线图,将自我改进分为 L1 到 L5:先按人类规则执行并沉淀成果,再自主选择改进策略、为短板生成训练任务、从真实环境积累 Skill 与工具,最终改造研究和自我训练的底层方法。它提供了一个判断 Agent 能力边界的分层框架:能完成任务、能选择方法、能自我训练、能适应现场与能改进自身机制,并不是同一层级。

来源:

Agent 开始在真实工作现场闭环处理故障

@xiaohu 转述 Anthropic 的演示:支付接口出错率超过 2% 后,Claude Tag 在 Slack 中自动拉取监控、比对近期上线和功能开关记录,约 15 分钟定位到重发程序缺少并发上限,并提出两个修复方案。工程师确认“加上限、保持功能开启”后,它只改了 4 行代码,并在上线后继续观察 10 分钟。这个案例的关键不在于完全放权,而在于 Agent 能查现场、给出可审阅的修复建议,同时把合并和上线保留在人类手中。

来源:

Grok Bot Galaxy 把“AI 造公司”变成公开实战

@poteto 预告,自己与 @mattyp、@roshan_s 将在 Grok Bot Galaxy 直播中只用 Grok Bot,从零开始做一家新公司,限时 3 天;随后他称直播报名约 7 万人。Elon Musk 转发的另一条实测显示,Grok Bot 会每天读取用户 X 书签,启动 Cursor Agent 制作 Demo,用截图或视频验证,再切出代码分支并通过 Cloudflare 预览部署。两条信号共同指向一种更具体的 Agent 闭环:从个人兴趣取材,自动生成可运行原型,再交给人审看。

来源:

AI 视频制作从“抽卡”转向白模与参考驱动

@derek_wall90176 认为,AI 视频真正难的是按设计稳定还原镜头,因此建议先让 Agent 调用 Blender 建立白模,确定人物位置、动作关系、机位和空间结构,再交给 MiniMax H3 渲染,把“结构确定性”和“视觉想象力”分开。@LufzzLiz 分享的敦煌群舞制作流程也采用类似思路:用 GPT-6 Astra 做视频理解、图片生成和拆分,再用 H3 全能参考生成两段视频,并要求五位成年角色在遮挡、转身和队形变化中保持身份一致。当前可见材料是创作者的实测与教程,说明的是工作流和效果,不等于模型已解决所有变形问题。

来源:

个人知识工具把阅读、AI 辅助和笔记合并到移动端

@vista8 发布的 Obsidian 电子书阅读器支持 EPUB、PDF、MOBI、AZW3、FB2 等格式,并可调用 Codex、Claude Code、ZCode、Kimi 或 DeepSeek API 辅助阅读;划线和笔记会写入 Markdown 文件,代码已开源,后续还补充了手机版适配教程。这类工具的价值不只是多一个阅读器,而是把文件渲染、跨模型辅助和可迁移的笔记沉淀放进同一条工作流,减少对单一阅读平台内置模型的依赖。

来源:

Agent 规模化后,瓶颈开始落到运行时与基础设施

@steipete 表示,下一版或开发频道会通过 APFS、Btrfs、XFS、ReFS 的文件夹克隆,让 worktrees 快约 80%,同时节省磁盘空间;在面向团队后,他还称当前环境约有 80 个会话并行运行而没有明显压力。另一方面,@rauchg 宣布 Google Cloud Run 的创建者 Steren 加入 Vercel,负责 Functions、Containers、Sandbox、Builds 等 Fluid 计算产品,并直指 Agent 需要新的计算原语。可见的变化是,Coding Agent 的竞争不再只在模型回答质量,也在代码隔离、并发会话、沙箱和构建运行环境。

来源:

AI 应用创业的分化点从开发速度转向增长与分发

@lifesinger 转述其朋友的观察称,硅谷 AI 应用创业公司常把增长团队与产研团队配成相近规模,因为有 AI 后产品研发可能只是时间问题,真正拉开差距的是流量和增长。@bbkirstry 则把 AI 变现归纳为七类:省时间、提效率、卖功能、卖判断、卖注意力、卖连接和卖资产。两者都属于博主的分析而非行业统计,但共同给出一个可执行判断:会做出产品只是起点,服务、订阅、内容、咨询和渠道等价值捕获方式,以及持续触达用户的能力,才决定能否跑出商业结果。

来源:

统计: 扫描时间线条数=476 命中的博主数=57 命中的推文总数=331 加权推文分=245.8 原创推文数=130 RT 推文数=87 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary