Opus 5 的长任务能力开始比“画鹈鹕”更值得测,但自检仍是短板
Karpathy公开的一次实验显示,Opus 5 用约 100 万 Token、约 10 美元预算和约两小时,把《指环王》开头改写成约 5500 行 Three.js 代码,程序化生成了可运行的 3D 世界。价值不在成品已经完美,而在于模型能够持续推进过去几乎没人会为一小段文字投入的定制工程;这让按需生成可探索世界、游戏或故事空间变得更现实。实验同时暴露出边界:模型主要靠分段截图检查结果,难以连续感知视频、交互和游戏状态,生成能力与验收能力仍有明显落差。
来源:
- @karpathy: https://x.com/karpathy/status/2083749667410727319
- @cellinlab: https://x.com/cellinlab/status/2083773912169718033
- @LufzzLiz: https://x.com/LufzzLiz/status/2083939849510502501
- @dotey: https://x.com/dotey/status/2083783368475361697
DeepSeek V4 Flash 的讨论重点转向“每个任务多少钱”和真实速度
MaxForAI转述 Artificial Analysis 的测算称,DeepSeek V4 Flash 0731 在同一套综合任务上的平均成本约为 0.03 美元,而 Fable 5 约为 3.15 美元;其引用的 Cline 提醒,单 Token 价格并不等于最终任务成本,因此这个数字应视为测评转述而非官方统一结论。小互的个人测试则称,网站翻译从过去 20–60 分钟缩短到约 3 分钟,单篇成本不到一毛钱。可见讨论正在从模型单价,转向多轮 Agent 任务能否以足够低的成本和延迟高频运行。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2083674847595680223
- @xiaohu: https://x.com/xiaohu/status/2083808984486855124
- @cline: https://x.com/cline/status/2083638204037820734
AI 视频从展示效果走向可交付的商业生产流程
小宇展示了用一张图片加一段提示词,在不到两分钟内生成连续切换七套衣服的换装视频,并称这类流程无需真人反复拍摄或剪辑;他还展示了提示词被其他创作者二创。行者AI视频转述其对 MiniMax H3 的六个商业场景实测,覆盖汽车官网动效、电商换背景、游戏概念 Demo、汽车组装、美妆 TVC 和饮料广告,结论是 AI 视频开始“能干活”,但 Seedance 2.5 并非唯一方案。上述是博主作品、实测和官方案例的可见信号,不等于所有场景都已稳定替代传统制作。
来源:
- @Chengzilhy: https://x.com/Chengzilhy/status/2083816931962798519
- @Chengzilhy: https://x.com/Chengzilhy/status/2083861863180480564
- @joshesye: https://x.com/joshesye/status/2083748660077007204
- @joshesye: https://x.com/joshesye/status/2083742275746594916
Google 第八代 TPU 把训练与推理拆成两条硬件路径
Google Cloud公开帖文介绍了 TPU 8t 与 TPU 8i:前者面向训练,后者面向后训练和实时推理,并称低延迟服务的性能价格比最高可提升 80%。小互的解读指出,训练更需要吞吐和大规模数据处理,Agent 场景的推理则更看重响应延迟;官方给出的 8t 规格包括 9600 颗芯片、121 exaflops 和 2 PB 共享内存,8i则强调通信密集任务的延迟下降。这个变化反映的是硬件围绕 Agent 多轮调用进行专门化,具体收益仍应以官方测试条件为准。
来源:
- @googlecloud: https://x.com/googlecloud/status/2083323071897747667
- @xiaohu: https://x.com/xiaohu/status/2083829267797041580
AI 产品化正在从单点模型调用转向可运行的复合工作流
levelsio称自己用“vibecoding”做出了一个网页视频编辑器,把视频生成、时间线编辑、补齐片段和原位重生成放进同一产品,并计划加入能操作界面的 Agent。卫斯理则在搭建面向自媒体工作的多个小工具,已把 DeepSeek、监控系统和 Google Spreadsheet 接入内部系统,预计把分散功能组合成工作流后提升内容产出效率。AI产品黄叔复盘称,其 Agent 社群 7 月销售近 200 份、80 名活跃用户下日消耗突破 200 亿 Token,并计划用教程、直播和分销继续扩张;这些经营数据均为当事人自报,说明的是个案产品化进展。
来源:
- @levelsio: https://x.com/levelsio/status/2083654998404268188
- @levelsio: https://x.com/levelsio/status/2083905572970053846
- @imwsl90: https://x.com/imwsl90/status/2083852100048757164
- @PMbackttfuture: https://x.com/PMbackttfuture/status/2083788439426650445
多 Agent 与长任务的瓶颈正在转向组织、上下文和验收
Gorden Sun转发的 CodexLoom 实践文章把问题拆成:单个 Task Agent 如何变成长运行 Agent、何时需要分化为多个 Agent,以及多 Agent 出现后瓶颈如何转移到人。宝玉的连续实践则认为,短期任务不必因为上下文达到 80% 就频繁 handoff,新开会话更适合相对独立的任务;真正重要的是给任务设置严格验收标准,例如用截图逐步比较像素差异。LufzzLiz据 Opus 5 案例补充,评测 Agent 应看它能否持续推进、修复错误、主动检查、预算不足时收尾,以及最终产物能否运行和交接。
来源:
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2083910690134475039
- @dotey: https://x.com/dotey/status/2083620982338486614
- @LufzzLiz: https://x.com/LufzzLiz/status/2083939849510502501
从“购买模型”到“把模型塞进场景”的产品入口正在被讨论
MaxForAI介绍一个北京酒吧的个案:顾客连接店内 Wi‑Fi 后,可在消费期间使用据称不限量的 DeepSeek V4 Flash API,并把 Base URL 和 Key 填入兼容客户端;他明确说明酒吧由朋友经营,因此这首先是单一场所的自报实践。paji_a进一步提出预测,AI会逐渐作为邮件、会计、设计和业务系统的默认能力存在,用户只感到服务变快变便宜,而不是主动购买模型。另有转发观点认为,WorkBuddy从一开始就做模型无关的 Harness,借此把产品入口从模型竞争中抽离;这些属于社媒讨论和产品判断,不能直接视为行业已确认趋势。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2083907939811922105
- @paji_a: https://x.com/paji_a/status/2083704438083277200
- @oran_ge: https://x.com/oran_ge/status/2083665570445377934
统计: 扫描时间线条数=240 命中的博主数=24 命中的推文总数=152 加权推文分=120.05 原创推文数=60 RT 推文数=30 抓取尝试次数=1 边界覆盖状态=tail_confidently_crossed_target_boundary