DeepSeek V4.1 Flash 进入内测并下调 API 价格,速度与效果仍需实测
多位博主转述 DeepSeek V4.1 Flash 已开放中间版本内测:保持原有 base_url、替换模型名即可调用,当前按 V4 Flash 计费,单账号并发上限被描述为 20。另有博主称其速度可超过 200 tokens/s,但已有实测认为它在部分任务上的效果和性价比仍不如 GLM 5.3 Flash,因此“更快、更便宜”与具体工作负载上的质量优势需要分开判断。
价格方面,公开转述的调价信息显示,9 月 10 日 12:00 起,Flash 缓存未命中输入价格由 1.5 元降至 1 元/百万 token,输出由 4.5 元降至 4 元,缓存命中输入由 0.05 元降至 0.02 元;最高 60% 的降幅只对应缓存命中部分,实际账单节省幅度取决于输入、输出和缓存占比。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2097353806921207838
- @MaxForAI: https://x.com/MaxForAI/status/2097229032819691627
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2097242012324114777
- @luoxiaoshan_ai: https://x.com/luoxiaoshan_ai/status/2097254810261258739
小米 MiMo Desktop 以邀测方式推出面向工作的桌面 Agent
小米 MiMo Desktop 已进入 invite-only beta,官方转引的开发者公告称邀测用户可限量免费使用新一代 MiMo 模型。可见介绍把它定位为工作型桌面 Harness:用户提交文件和目标后,系统负责拆解任务、调用工具并交付可继续编辑的 PPT、文档、网页、3D 或 App;网页 Demo 可直接运行检查,局部内容能单独修改并保留版本记录。
它还包含按任务复杂度自动选择模型、工具和执行框架的 Smart 调度,以及浏览器检索、填表和生成后交互验收。缓存命中率等性能数字仍属于产品方公布的测试数据,当前最值得观察的是邀测功能在真实长任务中能否减少返工。
来源:
- @XiaomiMiMo: https://x.com/XiaomiMiMo/status/2097237573261574326
- @MaxForAI: https://x.com/MaxForAI/status/2097221945100222550
Astra 类模型的价值开始体现为跨工具交付,而不只是单轮生成
Derrick Choi 展示了几类端到端用法:把桌面照片交给 Codex,在 Blender 中重建场景,再用 Three.js 做成可驾驶的浏览器小游戏;也展示了 Astra 通过应用内浏览器制作建筑图,以及从户型图开始在 Blender、Unreal Engine 5 中逐步扩建房屋。另有 Runta harness 的 30 项评测中,Codex 在固定模型、替换工具与 Agent loop 的设置下取得 66.7% 通过率,但样本很小,只能作为方向性信号。
这些案例的共同点是模型要连续完成理解素材、建模、调用软件、生成交互和检查结果,评价重点因此从“会不会写一段代码”转向“能否把工作交付出来”。
来源:
- @derrickcchoi: https://x.com/derrickcchoi/status/2097311894524883358
- @derrickcchoi: https://x.com/derrickcchoi/status/2097131863609590135
- @derrickcchoi: https://x.com/derrickcchoi/status/2097330801075794381
Agent 工程化的关键从提示词转向可验证的执行环境
围绕 Agent 自动写代码的实践显示,真正决定能否放权的不是一句更长的提示词,而是验证闭环。Lauren Tan 的经验包括让 Agent 能运行应用并检查结果,用功能地图和技能说明补齐产品与团队知识,再把反复出现的错误固化为自动检查;条件稳定后,才逐步允许云端 Agent 自动合并代码。另有工程工具展示把浏览器录制能力用于 review、测试和 QA,说明 Agent 的瓶颈正在从“生成代码”转向“验证交付”。
来源:
- @xiaohu: https://x.com/xiaohu/status/2097143342807269438
- @rauchg: https://x.com/rauchg/status/2097134278358548658
AI 科研 Agent 的价值在自动探索,但目标定义和解释责任仍在人
围绕百度“伐谋”的可见讨论以松材线虫病早期识别为例:科研团队过去需要多人反复试验光谱、植被指数和纹理等特征组合,AI Agent 则可以生成方案、运行实验、比较结果并决定下一轮探索方向。产品方更期待让 AI 持续扩展搜索空间,科研人员则强调必须说明结果为什么有效;这两者并不矛盾,前者扩大探索,后者负责目标、证据和科研责任。
相关介绍还提到,科研任务要先明确目标、约束和评价标准,否则 Agent 即使能自主迭代,也可能只是高效地优化错问题。关于成本节省等数字属于博主对播客内容的转述,仍应以实际使用验证。
来源:
- @vista8: https://x.com/vista8/status/2097228459210879201
- @xiaohu: https://x.com/xiaohu/status/2097202880570700054
Obsidian 正被改造成集资讯阅读、RSS 和学习笔记于一体的工作台
向阳乔木介绍的 Obsidian 插件已上架内置社区市场,主打把 46 个精选 AI Newsletter、1000 多个独立博客 RSS、本地文件夹和剪藏内容放进同一阅读与笔记流程,并支持翻译改写、指定日期记笔记和移动端使用。针对微信公众号,他还测试了自行部署 WeWeRSS、通过微信读书授权生成 RSS 的方案,但当前内容为空且不支持历史文章,属于仍需自行部署和验证的补充路径。
这类工具的价值不在单个“AI 总结”按钮,而在把发现信息、筛选、沉淀和回看串成低摩擦流程;公众号订阅方案的可用性则不能按已完成产品理解。
来源:
- @vista8: https://x.com/vista8/status/2097015487351914641
- @vista8: https://x.com/vista8/status/2096995036563144899
- @vista8: https://x.com/vista8/status/2097333369495560675
MiniMax 的多模态工作流开始交付可玩的交互成品
Cell 细胞记录了一次较完整的 MiniMax Code + H3 + Music 3.0 + Speech 2.8 工作流:视频负责动态场景,代码负责准星、开镜、命中和失败逻辑,图片、语音、音乐与音效共同组成场景,最后在真实浏览器中试玩并完成 214 项测试。这个案例的有效信息在于交付物不再是孤立的视频或代码片段,而是可以操作、调试和验收的游戏原型;它仍是单个博主的实测,不代表所有任务都能达到同样效果。
来源:
- @cellinlab: https://x.com/cellinlab/status/2097133381809328279
- @cellinlab: https://x.com/cellinlab/status/2097133394065019332
AIGC 视觉内容的署名争议推动可验证的创作留痕
TapNow 围绕一部视频的归属提出异议,称作品由签约创作者使用其平台制作,并强调完整画布、节点流程和生成时间可核验;另一条相关信息则指向去除水印、冒充产品 Demo 的争议。与此同时,视觉内容创作者被提醒保留风格烙印和工作留痕,不要把关键的风格化文字、代码和流程无保护地暴露给爬虫。
这些内容只能证明平台和博主公开提出了归属主张,不能据此替任何一方确认侵权事实;但它清楚说明,随着 AI 生成链条变长,来源、版本、节点和时间戳会成为作品归属与复现的重要证据。
来源:
- @TapNow_AI: https://x.com/TapNow_AI/status/2097317635537224011
- @TapNow_AI: https://x.com/TapNow_AI/status/2097317828236075272
- @94vanAI: https://x.com/94vanAI/status/2097136919079686496
Grok Bot 的产品化路径强调小团队、快速迭代和主动删减功能
Lenny Rachitsky 转述 Grok Bot 产品负责人的完整访谈:项目由独立小团队从零开始,首行代码后约四周完成,随后约三周面向全球发布;早期团队亲自 onboarding 约 200 至 300 名用户,并在上线前主动“下掉”部分功能。公开叙述还称产品上线不到一个月已出现数百万用户使用,但这是产品方访谈中的说法,日报将其作为可见发布信号而非独立验证的用户统计。
更值得复用的是方法:先用小团队和人工 onboarding 找到真实需求,再通过删减和收敛缩短发布路径,而不是一开始堆满功能。
来源:
- @lennysan: https://x.com/lennysan/status/2097340817967091933
- @lennysan: https://x.com/lennysan/status/2097038044926996587
统计: 扫描时间线条数=600 命中的博主数=61 命中的推文总数=396 加权推文分=305.85 原创推文数=160 RT 推文数=86 抓取尝试次数=4 边界覆盖状态=tail_confidently_crossed_target_boundary