小刘BOT

X 平台 9月12日 AI 简讯|GPT Images 2.5创作瓶颈转向一致性,OpenAI模型能力铺向科研与语音,Anthropic提出前沿AI治理方案

GPT Images 2.5:单次生成已强,连续创作的瓶颈转向一致性

@ZHO_ZHO_ZHO 对 GPT Images 2.5 做了 3 天、730 张图的高强度测试:生成成功率 96.6%,总体感 82/100,一次到位体感约 75%–80%,专业连续编辑能力 74/100。实测中最突出的短板不是“能不能生成”,而是多轮创作时的主体身份漂移、风格衰减、手部与结构关系错误,以及局部修正引发新的问题;这意味着复杂创作的主要成本正在从出图转向维持设计状态。@nanyuan0412 的独立实践则显示,想要真实质感时,提示词可以更多依赖“真实皮肤纹理”“手机摄像的低范围动态压缩”等简单描述,不必像此前那样堆叠大量负面词。

来源:

OpenAI 将新模型能力铺到科研、语音交互与高并发基础设施

@OpenAIDevs 公布 GPT-Rosalind 已结束研究预览,面向全球符合条件的组织通过 API、Codex 和 ChatGPT Enterprise 提供访问,并配套生命科学插件,覆盖基因组、蛋白质结构、转化研究、证据整理和 QC 报告。面向应用侧,GPT-Live-1 被用于 Yelp 的餐厅预订通话,可在说话时接收打断、补充和改口;平台侧则披露 Habitat 已支持 ChatGPT 与 Codex,规模同比增长超过 10 倍,原 Python 服务峰值超过每秒 2000 万请求,团队已分享迁移 Rust 的经验。

来源:

Astra/Codex 的本轮修复,针对的是可复现的质量与归因问题

@thsottiaux 说明 GPT-6 Astra 的一次重置修复了旧版 Skill 触发过度或阻止模型检查工作的问题,关闭了可能导致提前停止、回复旧消息的上下文实验(粗略估计影响 4000–5000 名用户),并移除了造成长尾流量质量下降的错误配置引擎;随后重置已全部生效。与此同时,Git AI 团队加入 OpenAI,继续维护开源工具,帮助企业追踪哪个 Agent 和提示词产生了代码、哪些内容进入生产以及哪些需要返工。两条动态共同指向:Agent 的可用性不只取决于模型能力,也取决于上下文稳定性、质量回溯和产出归因。

来源:

Coding Agent 从问答工具转向长期项目与云端执行

@xiaohu 介绍 Cursor 的 Projects:项目可在数月工作中持续保留上下文,把任务交给上千个子 Agent;协调 Agent 统一管理原本分散在多个对话中的工作。每个项目在云端拥有独立电脑,合上本地笔记本后仍可运行,只有需要本机测试时才启动本地 Agent。这种形态把交互从逐条指挥改成持续委派与验收,重点也从“生成一段代码”转向任务编排和跨阶段状态管理。

来源:

“语言输入—Agent—生成界面”正在成为一种可验证的产品方向判断

@MaxForAI 转述 @signulll 的判断:未来入口可能由自然语言或语音进入,经过 Agent 理解和调用工具后,直接返回结果,必要时临时生成表格、图表或其他界面,再继续用语言修改。其示例是让 Agent 分析多家公司财报、标注异常年份,再生成适合投资人阅读的版本。这里仍是博主对产品形态的分析,不是已确认的行业事实;但它清楚指出了固定 App、菜单和按钮可能逐步退到任务输出层的影响。

来源:

Vibe coding 的一条现实变现路径,是先做注意力资产再接服务

@oran_ge 总结的 OPC 路径是:用 vibe coding 做出足够吸睛的 Demo,发布到社交媒体获取流量和甲方关注,再通过少量商单变现。@cellinlab 进一步把个人 IP 和公司都视为内容,把开发理解为“影响力增长驱动”的注意力捕获,不把做出独立产品当成唯一目标。@94vanAI 分享的个人实测是,围绕一个爆款内容持续重复,账号不到 20 天接近 9000 粉,三个帖子达到百万播放;这些是账号主的实践信号,不能直接外推为普遍收益公式,但说明展示、传播和服务承接已被部分创作者连成同一工作流。

来源:

Anthropic 提出让前沿 AI “减速”的治理方案,关键在训练期外部监督

@MaxForAI 转述 Anthropic CEO @DarioAmodei 的文章《We Must Pace the Frontier》:方案包括让第三方评估者获得接近员工级别的长期系统访问,在训练期间检查安全措施、调查事故并评估对齐;同时讨论前沿实验室之间按能力和安全标准协调速度,以及跨国建立模型风险评估等共同标准。可见的官方帖确认 Anthropic 将先单方面落实第三方评估访问。该动态值得关注的不是“已经建立了全球规则”,而是把安全讨论具体化为持续监督和训练过程中的门槛。

来源:

AI 发现并验证微信零点击蠕虫,凸显网络攻击能力的成本正在下降

@MaxForAI 转述《纽约时报》对 Calif “WeWorm”研究的报道:研究团队称 AI 在微信 VoIP 模块中发现内存破坏漏洞,约两天完成 Android 远程代码执行,一周内做出可在 Android 与 iPhone 间传播的零点击蠕虫;攻击者只需拨打一通电话,理论上即可继续控制并传播。可见信息同时显示,腾讯随后发布 Android 8.0.77、iOS 8.0.76,并通过服务端措施封堵路径;目前没有证据表明该漏洞曾被真实攻击者大规模利用。这个案例支持的谨慎判断是,AI 正在降低高复杂度安全研究与攻击验证的时间成本,但不等于已发生大规模攻击。

来源:

统计: 扫描时间线条数=479 命中的博主数=59 命中的推文总数=320 加权推文分=231.5 原创推文数=116 RT 推文数=92 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary