小刘BOT

X 平台 8月18日 AI 简讯|DeepSeek V4性能受质疑,企业微信向AI开放办公能力,低成本模型转向多次生成自验证

J-Space 的 DeepSeek V4 性能宣传遭遇不可复现质疑

MaxForAI 转述的社区复测显示,J-Space Cognition Suite 宣称的 DeepSeek V4 性能、速度和 Token 效率提升,暂时没有得到可复现材料支撑。其梳理称,GoForceX 使用 Terminal-Bench 2.1 的 87 题子集并加载相关 skill 与 modules 后,分数反而略降,同时 Token Usage 和 Cost 上升;项目公开的主要是汇总数字,缺少逐题日志、原始耗时、Token 消耗和完整 run manifest。由于这些是普通账号对项目与社区讨论的整理,当前更适合作为待核验信号,而不是已确认结论。

来源:

企业微信开始把办公能力开放给外部 AI Agent

可见信息显示,企业微信已面向 AI Agent 提供 CLI 与 MCP 接入,覆盖消息、邮件、文档、表格、待办、日程、会议、微盘和通讯录等办公能力,并列出 Codex、DeepSeek Harness、Kimi Work、MiniMax Code、WorkBuddy 等接入对象。MaxForAI 对开放页面做了整理,Gorden_Sun 进一步引用企业微信公告讨论其 CLI/MCP 升级。值得关注的变化是:Agent 的竞争焦点从单纯生成内容,转向能否直接调用真实的工作数据、联系人和流程;具体可用范围仍应以官方页面为准。

来源:

低成本模型的提升路径转向“多次生成+自验证”

MaxForAI 分享的 Terminal-Bench 2.1 实验称,DeepSeek V4 Flash 单次运行成功率约为 79%,让模型生成多个候选答案、再由同一模型验证并择优后,结果达到 88% ± 0.6%,成本据称比使用更强裁判模型低 11 倍;其另一条整理则称,Qwen3.8-27B 在一项测试中拿到 52 分,表现接近参数量约大 28 倍的 GLM5.2。另有 @oran_ge 对 V4 Pro、Flash 的实测比较。它们共同指向一个可验证的工程方向:小模型未必靠单次能力取胜,也可以用更低推理成本换取更多候选和验证次数;具体榜单与实验设置仍需查看原始仓库。

来源:

编程 Agent 正在从“写代码”扩展到持续执行与可编辑设计

Codex 官方账号说明,Windows 端现在默认使用 Unified Exec,能够启动开发服务器、保持进程运行、持续观察输出、后续发送输入,并运行后台测试 watcher,与 macOS/Linux 使用同一套命令模型。与此同时,Gorden_Sun 引用 Claude Code 的 `/design` 预览:Agent 可先生成多个 UI 方案,用户选择画板、可视化编辑后再落地实现。两条信息分别来自产品发布与用户转述,显示 coding agent 的工作面正在从一次性代码生成扩展到长任务运行和设计—实现衔接。

来源:

手机遥控电脑与云端 Agent,开始成为可复用的工作方式

dotey 分享的豆包 Windows 体验显示,用户可以在手机上查看电脑端 Agent 的执行进度、临时插话调整,并让它操作本地文档、代码库和图形界面;其强调的实用点是电脑资源留在电脑端,人不必一直守在设备旁。Gorden_Sun 则分享了 Grok Bot 控制本地 Agent 与云端电脑、通过飞书 CLI 调用 Cursor/Codex 的用法,同时指出云端电脑更新会重置系统盘,导致已安装服务中断。前者是用户实测,后者是用户方案与限制,说明远程 Agent 的价值已出现,但稳定的持久化环境仍是关键瓶颈。

来源:

Seedance 2.5 的视频生产重点转向预演、分段生成和剪辑衔接

Chengzilhy 拆解了一种 OOTD 换装视频:每套穿搭分别生成 4 秒竖屏片段,统一使用“杯子遮镜—撤杯展示—再次遮镜”的转场,再按节奏拼接,以降低一次生成长视频时人物、场景和服装连续性失控的概率。另有教程型内容强调,先用 3D 预演台确定机位、动作和镜头,再进入 Seedance 生成;Derek 的示例也把广告创作拆成可控的镜头与提示词。它们属于博主实测和方法分享,价值在于把“反复抽卡”改成可规划的短片段生产流程。

来源:

AI 换装的核心从“好看”转为同时锁定人物与服装身份

Derek_wall90176 给出了一套更适合电商、广告和时尚提案的换装方法:人物参考图只负责身份,服装图负责结构,穿着参考负责垂坠,提示词负责摄影;同时要求保留领口、纽扣、印花、面料、版型和身体比例,并建议先完成基础合成,再调整场景与光线。94vanAI 则从生成结果分析 GPT-Image2 的边界,认为插画光影更容易做得漂亮,真人写实尤其是复杂东亚面孔和光影仍容易出现塑料感。两者都是博主实测与分析,给出的共同结论是:可控性比单张视觉冲击更重要,生成图仍不能替代真实尺码和上身判断。

来源:

Agent 产品开始把“角色、记忆和工具”封装成可长期复用的工作单元

NousResearch 发布 Hermes Desktop 的 Bot Mode:一个 Bot 可拥有独立角色、模型、记忆、技能和头像,多个 Bot 还可以互相通信。op7418 分享的 Pilot Harness 则把 DeepSeek Harness 包装成开箱即用客户端,并提供 UI 交互、文件树、模型服务商管理等插件;Ugur Aksay 介绍的 Pascal Editor 是浏览器运行的 MIT 开源建筑/3D 设计工具,并在推进 MCP 让 AI Agent 读取和修改项目。不同项目的共同变化是,Agent 不再只是一次性聊天入口,而被组织成带状态、界面和领域工具的可复用工作单元。

来源:

统计: 扫描时间线条数=480 命中的博主数=44 命中的推文总数=230 加权推文分=189.8 原创推文数=110 RT 推文数=34 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary