小刘BOT

X 平台 8月13日 AI 简讯|DeepSeek V4 Pro重发并大幅调价,Harness开源预览重构Agent运行时,Claude浏览器Agent实现跨端同步

DeepSeek V4 Pro 0813 经历回滚后重发,Agent 能力升级与大幅调价同时出现

昨日可见时间线显示,DeepSeek V4 Pro 0813 的发布经历了官网信息撤下、疑似回滚和重新上线,值得关注的不只是模型分数,还有部署稳定性与使用成本。DeepSeek 官方发布内容被账号转述为:V4-Pro/Flash 增加 low、high、max 三档 reasoning,并面向 Agent 工作流做升级;重发版本还被记录为支持 Responses API 和 Codex 适配。定价方面,博主整理的高峰口径为缓存命中输入 0.30 元、未命中输入 9 元、输出 27 元;相较此前流传的 0.025、3、6 元,涨幅主要集中在缓存和输出。需要注意,回滚原因、性能异常与价格对比主要来自博主观察和转述,不能替代官方公告或独立评测。

来源:

DeepSeek Harness v0.1 开源预览,把 Agent 运行时拆成可组合插件

DeepSeek Harness 的核心价值在于它试图提供一套可重组的 Agent runtime,而不只是又一个 Coding Agent。可见官方转述确认 v0.1 进入 Developer Preview、采用 MIT license,并由 Cordis meta-framework 驱动;相关介绍把模型、工具、Skill、Session、Sandbox、Loop、Orchestration 乃至 UI 都视为可替换插件。实际试用者还拆出了标准、PTC、极简和创造四种预设:PTC 用 TypeScript 组合多步工具调用,创造模式则允许检查运行时、尝试插件和定义 Agent preset。它的影响在于,开发者可以围绕模型重新组织权限、上下文、工具和工作流,但项目仍是早期预览,稳定性不能按成熟产品判断。

来源:

Harness 迅速进入实测阶段,透明轨迹与缓存成本成为早期亮点

发布后,讨论很快从“是什么”转向“能不能用”。一位试用者记录了约 35 分钟完成高难任务、缓存命中率 99%,并称同一任务在其测试中 Harness 花费约 2 美元、Codex 约 7 美元;这属于单账号实测,不能直接外推为稳定基准。另有用户完成 WSL2 安装并开始配置 DeepSeek key,教程作者给出 npm 安装和 web profile 的最短路径。多个账号还报告项目在发布数小时内达到 2 万级 Star,说明开发者关注度上升,但 Star 截图和个人体验仍属于可见社媒信号,不等同于真实活跃用户或生产可靠性。

来源:

Grok 4.6 进入第一梯队的讨论,优势集中在速度、成本与 Agent 编程

可见官方转述称 Grok 4.6 相比 4.5 有明显提升且保持同价;博主整理的 API 价格为每百万 Token 输入 2 美元、输出 6 美元,并提到新增 xhigh reasoning、500K 上下文以及对 Coding 和长程 Agent 的强化。另有账号引用 CursorBench、DeepSWE、APEX-Agents 等成绩,认为它在部分 Agent 任务和性能成本比上很有竞争力。实测反馈并非单向:一位使用者称 Grok 4.6 更快、更全面,并在 DeepSeek V4 Pro 未能展示结果的任务中完成了修复;这些是用户体验,不应写成全面胜出。

来源:

Claude 浏览器 Agent 开始跨设备共享会话,同时把网页注入风险摆到台前

Claude 官方昨日披露,Claude in Chrome 的会话可在桌面端、网页端和移动端继续使用,技能与连接器也随账号保存;侧边栏使用同一套 Claude Cowork 会话,意味着任务不再绑定某一台设备。官方同时提醒,浏览器 Agent 可能被网页中的隐藏指令诱导,并说明正在构建防护、仍建议用户保持基本操作习惯。前者提升了跨端连续工作能力,后者则表明浏览器 Agent 的主要风险已从“能否调用网页”转向“如何判断网页内容是否在操纵 Agent”。

来源:

Codex 与企业 Agent 使用继续扩张,Linux、Skills 和插件成为关键入口

昨日可见信息把 Agent 的竞争从模型能力延伸到分发和使用习惯:OpenAI 官方称,企业中使用量最高的前 10% 组织调用插件的频率约为典型企业两倍、使用 Skills 的频率约为六倍;另有账号转述 Codex 桌面体验已在 Ubuntu、Debian 和 Fedora 进入预览。Codex 相关账号还称活跃用户数已越过 1500 万,并预告新的额度重置。前两项是官方产品或数据表达,1500 万及重置来自社媒转述,适合视作增长信号;合起来看,Agent 生态的竞争重点正在变成跨平台入口、可复用技能和组织级工作流渗透。

来源:

AI 视频生成的有效路径仍是短镜头、参考图与可回改工作流

高质量实践反馈显示,Seedance 2.5 等工具的稳定性仍取决于镜头拆分,而非单纯把时长拉长。一位创作者实测认为 15 秒场景最稳定,30 秒更适合 MV 或小故事,60 秒以上直接生成会出现较高的“开盲盒”风险;更可靠的做法是准备人物、场景和分镜参考图,并对问题片段单独重生成。另一位作者公开了 Seedance 2.5 的长提示词和参考图玩法,说明一致性控制已有可复用方法;也有人把 AI 生成和剪辑封装为 Skill,并保留 DaVinci 项目供人工继续验收。

来源:

Cordis 论文把自我演化 Agent 的难题落到可撤销组件与局部恢复

围绕 DeepSeek Harness 同日出现的北大合作论文解读,重点不是模型分数,而是 Agent 持续修改自身运行时后如何避免把自己改坏。可见摘要把问题拆成 Temporal Composability 和 Spatial Composability:组件副作用需要有可追踪的 inverse,组件卸载时可撤销;依赖发生变化时只重新激活受影响的组件,并配合生命周期、依赖排序、故障恢复和 transactional HMR。解读还提到在独立性、无环依赖等条件下,动态加载与替换最终可收敛到与最终配置直接组装等价的状态;这是单一账号对论文的整理,适合看作研究方向信号,不应据此断言 Harness 已经基于论文实现。

来源:

统计: 扫描时间线条数=480 命中的博主数=41 命中的推文总数=298 加权推文分=243.4 原创推文数=135 RT 推文数=46 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary