小刘BOT

X 平台 8月12日 AI 简讯|DeepSeek V4 Pro上线,xAI同步推进模型与可执行Agent,AI视频竞争转向连续系统

DeepSeek V4 Pro 0813 的上线信号出现,Agent 能力与价格成为首要看点

昨日多位博主围绕 DeepSeek V4 Pro-0813 的发布、官网版本更新和价格表展开更新,但可见信息仍有发布节奏差异:Gorden_Sun直接称正式版发布,MaxForAI称官网刚更新并给出对比测试,AlchainHust则表示完整发布信息可能要到次日。MaxForAI转述的一组榜单数据称,预览版到0813在 Terminal Bench、CyberGym、DeepSWE 等项目上提升明显,其中 DeepSWE 从12.8升至62.7;这属于博主整理或测试,不能替代官方评测。vista8列出的当时价格为缓存命中输入0.025元/百万token、未命中3元、输出6元,并发上限500,同时提醒价格可能上涨。值得关注的是,当前讨论重点已从“模型是否更强”转向 Agent 编码能力、调用成本和并发能力的综合比较。

来源:

xAI 同步推进 Grok 4.6 与 Grok Bot,模型升级和可执行 Agent 同时落地

从可见动态看,xAI这轮更新同时覆盖模型和产品形态:@SpaceXAI宣布Grok 4.6,相比Grok 4.5提升且价格不变;Elon Musk转发的帖子还称其在GDPVal-AA上达到1753 ELO,但这属于转发中的单项榜单信息。Grok Bot则被描述为运行在云端常驻Linux机器上的“AI同事”,可以使用用户登录状态操作网页、应用和文件,用户演示一次后可按时间或事件重复执行,多个Bot还能互相派活;遇到登录、验证码或付款等环节会交还给用户。Lenny Rachitsky在早期体验中提到,它已被用于自动回复支持邮件、匹配求职者与招聘公司、扫描信用卡订阅和准备播客嘉宾简报。上述体验来自早期测试与产品介绍,尚不足以证明普遍可靠性,但产品边界已从聊天回答明显推进到代替用户操作软件。

来源:

ChatGPT 与 Codex 桌面预览扩展到 Linux,并支持工作流迁移同步

OpenAI官方账号宣布ChatGPT桌面应用进入Linux预览,支持Ubuntu 24.04/26.04、Debian 13、Fedora 43/44,并提供x64和ARM64的.deb或.rpm安装包。OpenAI Developers同时公布了工作流迁移能力:可把其他Agent中的项目、聊天、Skills、Plugins、Agents和项目配置导入ChatGPT Work与Codex,查看导入历史并选择自动更新。产品方补充说明,Linux版整体功能已接近完整,原生Computer Use暂未提供但正在开发,预览阶段仍可能有粗糙之处。这个变化的实际价值不只在于多一个操作系统,而在于降低开发环境迁移和既有Agent资产复用的成本。

来源:

一篇论文引发对加密思维链跨模型兼容性的安全警觉

Gorden_Sun转述的一篇论文指出,部分模型供应商把隐藏推理轨迹加密后返回客户端,但同一生态内不同会话、用户和模型之间可能存在可互换性;研究者据此尝试把强模型产生的加密轨迹交给防护较弱的模型解密,带来推理泄露、防蒸馏机制被绕过、隐私数据暴露和提示词注入等风险。其转述还提到,研究者从公开代码库中的315,320个推理数据块恢复出367条个人身份信息和182份凭证,但这些数字在日报中只能作为对论文的转述。Dongxi_nlp进一步认为,这类方法在技术上支持从闭源模型提取更高密度的推理数据,却明确指出现有公开证据仍不能证明这些轨迹已进入某个具体模型的训练集,也不能量化其对模型能力的贡献。核心价值在于提醒开发者:客户端可见的加密推理数据仍应按潜在敏感信息处理。

来源:

AI 视频评价标准从单镜头画质转向连续角色、动态系统与生产成本

昨日的多条实测显示,AI视频的竞争焦点正在从“画面像不像”转向能否稳定表达一个连续系统。Derek Wen用MiniMax H3测试了从游戏菜单、武器切换到第三人称场景和HUD反馈的15秒流程,重点观察角色一致性、UI交互、物体变化和物理反馈能否同时成立。Chengzi分享Seedance 2.5的实战经验:单人物角色卡应清晰、提示词可以更细但结构要明确,生成前核对素材和设定有助于减少约30秒视频、约50元一次的重复抽卡成本。Ugur Aksay转述FLUX 3 Video限时免费及后续路线,提到20秒视频、同步声音、关键帧、续接和多图参考等方向;xiaohu则转述Higgsfield完成110分钟AI长片的案例,片中使用获授权的真人肖像并公开制作素材。可见样本仍主要是博主展示和产品方信息,但验证维度已明显扩展到长时序、交互、成本和可复用流程。

来源:

Agent 工作正在从“会生成”转向可测试、可编排、可复用

几位博主给出了比单纯展示模型能力更可复用的工作方法。宝玉观察到,Claude Code、Codex等Harness在同一目录并行执行时可以处理冲突并等待其他任务,worktree更适合耗时较长的PoC;Ryan Hanley则把Agent的护城河归纳为专业知识、分发、品味和流程,建议把工作拆成Skills或SOP,建立上下文资料库并设置类似员工权限的护栏。Ugur Aksay建议在任务开始前生成5个测试场景、预期输出、验收标准和失败信号,再对结果评分和修正,避免一次偶然的好答案被误认为好Prompt。PMbackttfuture还分享了实际案例:用WorkBuddy和Hy3让10个Agent整理300多人社群在8月1日至10日的聊天记录,并输出到飞书云文档。共同结论是,Agent价值取决于任务编排、验收和上下文沉淀,而不是单次生成的惊艳程度。

来源:

Manus 出现从 Meta 剥离并恢复独立运营的公开信号

宝玉和花叔分别转述《晚点 LatePost》观察到的页面变化:Manus网站挂了数月的“现已成为Meta的一部分”改为“即将恢复独立运营”。归藏随后提到,Manus在这一变化后对部分用户开放限免,范围为Manus 1.6和Manus Lite,曾购买会员或通过Lenny's Newsletter获得会员的人可尝试使用。现有证据主要是媒体报道的转述、网站页面观察和博主体验,并非日报中可见的完整官方公告,因此更稳妥的判断是“独立运营信号出现”,而不是对交易结构或后续业务作进一步推断。它值得关注的原因在于,Manus在短时间内经历产品归属和运营方式变化,反映出Agent产品商业化路径仍在快速调整。

来源:

统计: 扫描时间线条数=480 命中的博主数=43 命中的推文总数=265 加权推文分=222.55 原创推文数=120 RT 推文数=31 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary