DeepSeek V4 Pro 0813 经历回滚后重发,Agent 能力升级与大幅调价同时出现
昨日可见时间线显示,DeepSeek V4 Pro 0813 的发布经历了官网信息撤下、疑似回滚和重新上线,值得关注的不只是模型分数,还有部署稳定性与使用成本。DeepSeek 官方发布内容被账号转述为:V4-Pro/Flash 增加 low、high、max 三档 reasoning,并面向 Agent 工作流做升级;重发版本还被记录为支持 Responses API 和 Codex 适配。定价方面,博主整理的高峰口径为缓存命中输入 0.30 元、未命中输入 9 元、输出 27 元;相较此前流传的 0.025、3、6 元,涨幅主要集中在缓存和输出。需要注意,回滚原因、性能异常与价格对比主要来自博主观察和转述,不能替代官方公告或独立评测。
来源:
- @op7418: https://x.com/op7418/status/2087863955150799113
- @MaxForAI: https://x.com/MaxForAI/status/2087866632333107572
- @LufzzLiz: https://x.com/LufzzLiz/status/2087701319922729056
- @oran_ge: https://x.com/oran_ge/status/2087873150747115608
DeepSeek Harness v0.1 开源预览,把 Agent 运行时拆成可组合插件
DeepSeek Harness 的核心价值在于它试图提供一套可重组的 Agent runtime,而不只是又一个 Coding Agent。可见官方转述确认 v0.1 进入 Developer Preview、采用 MIT license,并由 Cordis meta-framework 驱动;相关介绍把模型、工具、Skill、Session、Sandbox、Loop、Orchestration 乃至 UI 都视为可替换插件。实际试用者还拆出了标准、PTC、极简和创造四种预设:PTC 用 TypeScript 组合多步工具调用,创造模式则允许检查运行时、尝试插件和定义 Agent preset。它的影响在于,开发者可以围绕模型重新组织权限、上下文、工具和工作流,但项目仍是早期预览,稳定性不能按成熟产品判断。
来源:
- @op7418: https://x.com/op7418/status/2087887711881597009
- @LufzzLiz: https://x.com/LufzzLiz/status/2087896797276676436
- @aiwarts: https://x.com/aiwarts/status/2087900211024969892
- @tuturetom: https://x.com/tuturetom/status/2087909114651275693
Harness 迅速进入实测阶段,透明轨迹与缓存成本成为早期亮点
发布后,讨论很快从“是什么”转向“能不能用”。一位试用者记录了约 35 分钟完成高难任务、缓存命中率 99%,并称同一任务在其测试中 Harness 花费约 2 美元、Codex 约 7 美元;这属于单账号实测,不能直接外推为稳定基准。另有用户完成 WSL2 安装并开始配置 DeepSeek key,教程作者给出 npm 安装和 web profile 的最短路径。多个账号还报告项目在发布数小时内达到 2 万级 Star,说明开发者关注度上升,但 Star 截图和个人体验仍属于可见社媒信号,不等同于真实活跃用户或生产可靠性。
来源:
- @LufzzLiz: https://x.com/LufzzLiz/status/2087918358188695712
- @imwsl90: https://x.com/imwsl90/status/2087909742102581688
- @aiwarts: https://x.com/aiwarts/status/2087892836587106452
- @AlchainHust: https://x.com/AlchainHust/status/2087916355307618397
Grok 4.6 进入第一梯队的讨论,优势集中在速度、成本与 Agent 编程
可见官方转述称 Grok 4.6 相比 4.5 有明显提升且保持同价;博主整理的 API 价格为每百万 Token 输入 2 美元、输出 6 美元,并提到新增 xhigh reasoning、500K 上下文以及对 Coding 和长程 Agent 的强化。另有账号引用 CursorBench、DeepSWE、APEX-Agents 等成绩,认为它在部分 Agent 任务和性能成本比上很有竞争力。实测反馈并非单向:一位使用者称 Grok 4.6 更快、更全面,并在 DeepSeek V4 Pro 未能展示结果的任务中完成了修复;这些是用户体验,不应写成全面胜出。
来源:
- @op7418: https://x.com/op7418/status/2087582937395147196
- @MaxForAI: https://x.com/MaxForAI/status/2087573394946691128
- @LufzzLiz: https://x.com/LufzzLiz/status/2087898560746635660
- @levelsio: https://x.com/levelsio/status/2087579763158216795
Claude 浏览器 Agent 开始跨设备共享会话,同时把网页注入风险摆到台前
Claude 官方昨日披露,Claude in Chrome 的会话可在桌面端、网页端和移动端继续使用,技能与连接器也随账号保存;侧边栏使用同一套 Claude Cowork 会话,意味着任务不再绑定某一台设备。官方同时提醒,浏览器 Agent 可能被网页中的隐藏指令诱导,并说明正在构建防护、仍建议用户保持基本操作习惯。前者提升了跨端连续工作能力,后者则表明浏览器 Agent 的主要风险已从“能否调用网页”转向“如何判断网页内容是否在操纵 Agent”。
来源:
- @claudeai: https://x.com/claudeai/status/2087635262390026525
- @claudeai: https://x.com/claudeai/status/2087635263774232617
- @claudeai: https://x.com/claudeai/status/2087635265066004694
Codex 与企业 Agent 使用继续扩张,Linux、Skills 和插件成为关键入口
昨日可见信息把 Agent 的竞争从模型能力延伸到分发和使用习惯:OpenAI 官方称,企业中使用量最高的前 10% 组织调用插件的频率约为典型企业两倍、使用 Skills 的频率约为六倍;另有账号转述 Codex 桌面体验已在 Ubuntu、Debian 和 Fedora 进入预览。Codex 相关账号还称活跃用户数已越过 1500 万,并预告新的额度重置。前两项是官方产品或数据表达,1500 万及重置来自社媒转述,适合视作增长信号;合起来看,Agent 生态的竞争重点正在变成跨平台入口、可复用技能和组织级工作流渗透。
来源:
- @OpenAI: https://x.com/OpenAI/status/2087912623883051300
- @imwsl90: https://x.com/imwsl90/status/2087701346237682105
- @thsottiaux: https://x.com/thsottiaux/status/2087706104814023111
AI 视频生成的有效路径仍是短镜头、参考图与可回改工作流
高质量实践反馈显示,Seedance 2.5 等工具的稳定性仍取决于镜头拆分,而非单纯把时长拉长。一位创作者实测认为 15 秒场景最稳定,30 秒更适合 MV 或小故事,60 秒以上直接生成会出现较高的“开盲盒”风险;更可靠的做法是准备人物、场景和分镜参考图,并对问题片段单独重生成。另一位作者公开了 Seedance 2.5 的长提示词和参考图玩法,说明一致性控制已有可复用方法;也有人把 AI 生成和剪辑封装为 Skill,并保留 DaVinci 项目供人工继续验收。
来源:
- @joshesye: https://x.com/joshesye/status/2087818713235869905
- @Chengzilhy: https://x.com/Chengzilhy/status/2087893007039422809
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2087739199583920569
Cordis 论文把自我演化 Agent 的难题落到可撤销组件与局部恢复
围绕 DeepSeek Harness 同日出现的北大合作论文解读,重点不是模型分数,而是 Agent 持续修改自身运行时后如何避免把自己改坏。可见摘要把问题拆成 Temporal Composability 和 Spatial Composability:组件副作用需要有可追踪的 inverse,组件卸载时可撤销;依赖发生变化时只重新激活受影响的组件,并配合生命周期、依赖排序、故障恢复和 transactional HMR。解读还提到在独立性、无环依赖等条件下,动态加载与替换最终可收敛到与最终配置直接组装等价的状态;这是单一账号对论文的整理,适合看作研究方向信号,不应据此断言 Harness 已经基于论文实现。
来源:
统计: 扫描时间线条数=480 命中的博主数=41 命中的推文总数=298 加权推文分=243.4 原创推文数=135 RT 推文数=46 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary