Agent 使用量上升,模型层开始走向可替换
可见数据把 Agent 的竞争重点从“调用次数”推向持续运行的调用深度和模型可替换性。@MaxForAI 转述的 a16z/OpenRouter 数据称,Agent Token 消耗接近人工直接调用的 5 倍,自 2 月增长约 14 倍,其中 85% 以上是 Cached Prompt;OpenAI 企业客户中,Codex 已占 Codex 与 ChatGPT 合计输出 Token 的 64%,法律、销售和招聘的 Codex 周活增长也明显快于工程。另一个来自 Vercel AI Gateway 的可见信号是,开放权重模型 Token 占比从 6 月 24 日的 28.4% 升到 8 月 22 日的 62%。这仍是平台侧样本,不等于全行业份额,但说明工作流正在要求 Agent 能切换不同模型。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2091224192717066368
- @MaxForAI: https://x.com/MaxForAI/status/2091294750846672988
- @dotey: https://x.com/dotey/status/2091425749739643124
Instant 团队加入 OpenAI,Agent 后端基础设施成为补齐重点
Instant 官方宣布整个团队加入 OpenAI,公开信息显示这支团队此前做的是面向 AI Coding/Agent 的后端基础设施,覆盖数据库、认证、权限、存储、实时同步和离线缓存。@MaxForAI 转述称,Instant 已有超过 1 万 GitHub Star,官方还称服务过 1.7 万用户、40 万个 App、处理 25 亿笔交易;这些数字在日报中仅作为原帖可见信息保留。Instant Cloud 计划继续支持现有应用约 12 个月、备份保留约 24 个月,开源版本可继续 self-host。官方没有公布交易金额,也没有明确说这是完整收购,确定事实是“团队加入 OpenAI”。
来源:
Ox Alpha 的多模态与代码能力出现可用实测,但响应效率仍是短板
Ox Alpha 已出现从“能聊天”走向“直接完成视觉代码任务”的可见信号。@op7418 用参考图要求它以 WebGL 还原网页,称其做出了 3D 玻璃材质、透视、文字位置和排版细节,并进一步与 DeepSeek V4 Flash、Vision EXP、Claude Fable 5 做同提示词对比;@NousResearch 则宣布 Ox Alpha 在 Nous Portal 限时免费。与此同时,@oran_ge 反馈国产 Flash 级模型在复杂任务中可能长时间思考、很久才输出,这提示能力展示和实际交互效率仍需分开评价。
来源:
- @op7418: https://x.com/op7418/status/2091395283028738303
- @op7418: https://x.com/op7418/status/2091456254669709671
- @NousResearch: https://x.com/NousResearch/status/2091227797473640595
- @oran_ge: https://x.com/oran_ge/status/2091284339728470145
Marin 535B-A23B 启动公开训练,训练过程本身成为研究产物
@MaxForAI 转述 @percyliang 的公开信息称,Marin 535B-A23B 已开始训练:总参数 535B、激活参数 23B,计划使用 18.75T tokens、11 套 GB200 NVL72,连续约 3 个月,预计计算量约 2.7e24 FLOPs。项目在正式训练前先跑了 4 级 Scaling Ladder,并计划持续公开训练曲线、数据、实验记录和工程问题。这里的确定信息是训练方案和公开过程;模型最终能力仍需等训练及后训练结果验证。
来源:
AI 算力扩张同时撞上电力、水和内存成本约束
来自社媒转述的两条信息共同指向同一现实:AI 基础设施的瓶颈已不只是 GPU 数量。关于内蒙古乌兰察布,@MaxForAI 转述称当地已有近 100 个数据中心投入运营或开工,企业承诺的规划容量达 12.5GW,过去一年宣布的部分超过 70%;但当地降水少、供水紧张,电力中仍有约 37% 来自煤炭。另一条转述称,Nvidia Vera Rubin 和 Grace Blackwell 系统的部分 AI 服务器可能因 DRAM 成本上升而涨价超过 15%。两者均是博主引用 Wired/Bloomberg 等外部报道后的可见信号,不能替代原始报道核验。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2091417711515783528
- @MaxForAI: https://x.com/MaxForAI/status/2091415807058440277
公开语音评测暴露题库污染,过程数据比榜单分数更值得检查
@Gorden_Sun 转述的一项研究发现,部分语音识别模型可能记住公开题库,而不是完整听懂音频:录音中被静音的数字仍被写出,原始录音里的漏字也会被模型照抄;换成全新录音或声音后,原先的高分明显下降。与此同时,Patronus AI 的 FigmaTrace 收集了 200 多小时设计师在 Figma 中从草图、排版到细节修改的操作记录,并按设计阶段切分,作为 AI 学习设计意图的开放素材。两条信号都说明,评估与训练不能只看静态结果,还要检查数据泄漏、过程行为和对新样本的泛化。
来源:
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2091435229332504844
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2091437604231110922
普通用户已在使用 AI,但心智模型仍停留在“更好的聊天机器人”
@Gorden_Sun 转述对非技术亲友的观察:有人已经用 AI 做网页应用并订阅高价套餐,律师每天使用 AI,却更偏好个人版 ChatGPT/Claude 而不是公司批准的 Copilot;药剂师所在医院已采购 AI 自动发药机器人,也加剧了被替代焦虑。观察中几乎没人关心模型名称、推理等级或 Agent 概念,重度用户最在意的是“把工作搞定”;消费级产品体验领先,也让用户绕开企业批准工具。这个样本反映的是社媒可见的个人观察,不是总体调查,但清楚呈现了技术圈讨论与真实使用之间的落差。
来源:
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2091425759042916493
生图工作流从堆提示词转向一致性与视觉导演系统
@94vanAI 在完成三期、历时 4 个月的 GPT-Image 2 专栏后总结,提示词本身不是绘图关键,更重要的是审美、理解模型并通过视觉语言、角色身份、资产系统和手绘等方式稳定控制模型。@nanyuan0412 的实测给出可复用的操作结论:固定人物与成片质感,只改变服装、动作、机位和道具,同一张脸可以保持 10 套造型的一致性。对系列图而言,一致性不是每张图相同,而是让它们像同一次拍摄,这比单张出图效果更接近可复用生产流程。
来源:
- @MANISH1027512: https://x.com/MANISH1027512/status/2091541742906470578
- @94vanAI: https://x.com/94vanAI/status/2091548888956317731
- @nanyuan0412: https://x.com/nanyuan0412/status/2091431445768351973
统计: 扫描时间线条数=360 命中的博主数=33 命中的推文总数=190 加权推文分=152.35 原创推文数=80 RT 推文数=33 抓取尝试次数=2 边界覆盖状态=tail_confidently_crossed_target_boundary