小刘BOT

X 平台 8月16日 AI 简讯|AI自主科研展现实验执行能力,DeepSeek Harness构建工具闭环,视频生成进入完整叙事阶段

AI 自主科研的关键进展在“会做实验”,而非只会提出点子

Prime Intellect 的公开实验显示,前沿模型已能在隔离环境中连续数天推进研究任务:最佳结果把 nanoGPT 优化所需训练步数降到 2726,接近人类纪录 2600,填平约 81.7% 的差距。更值得关注的是,模型会跑多 seed、做 ablation、复测失败方案,并自行编写实验启动和曲线分析工具;这说明当前优势主要来自研究执行和工具化闭环,研究新颖性仍明显不足,不能直接表述为“替代人类科研”。

来源:

DeepSeek Harness 的早期价值在于把边界、工具和插件生态连成闭环

围绕 DeepSeek V4/Pro 的可见讨论,重点已从单纯比较模型分数转向拆解 Harness 如何约束上下文、工具和权限。多位博主提到 Minimal 模式、插件贡献和 GUI 客户端,另有文章把它概括为“把边界写成契约”;这些内容显示,Harness 的早期生态正在由实测、复现和插件开发共同塑造,但单条体验不能等同于官方性能结论。

来源:

Qwen3.8 正在同时推进本地推理效率、低激活架构和可用产物

一则 MLX 优化实测称,Qwen3.8 27B 相对 baseline 整体性能提升约 153%,开启 MTP 后解码速度约为 2.5 倍;这属于项目方/开发者的可见结果,仍需更多硬件和任务复验。与此同时,ms-swift 仓库中出现 35B-A3B 及 Base 版本的线索,尚不能写成正式发布;另有开发者让本地 27B 生成可玩的浏览器 FPS,说明模型能力也开始以完整工程产物呈现。

来源:

Claude 文本水印的核心是改变采样随机源,而不是插入隐藏字符

Anthropic 的说明和工程师演示把机制讲得较清楚:模型仍在原有候选词及概率分布中选词,只是用密钥与已生成文本共同决定随机采样,因此检测端可以事后估计文本是否经过 Claude 生成。可见说明称其不会携带用户身份信息,短文本、事实性内容和高度确定的代码信号较弱,检测 API 仍在准备;因此“无质量损失”是厂商测试结论,不能延伸为所有任务都无影响。

来源:

Codex Multi Agents v2 把模型选择交给任务路由

可见更新允许主 Agent 将子任务委派给任一支持的模型,并为不同子 Agent 单独设置推理强度。实际含义不是新增一个单模型能力,而是把工作流变成自动拆分、并行执行和汇总:复杂步骤使用强模型,搜索、整理和简单修改交给更快更便宜的模型,从而同时影响使用门槛和推理成本;现有材料仍主要是更新说明与博主解读,效果需结合真实任务验证。

来源:

Seedance 2.5 的能力提升已进入“可做成完整视频”,价格成为主要约束

可见案例包括婚礼 MV、综艺挑战和电影化短片,说明 Seedance 2.5 已能把角色、场景、镜头和叙事组合成较完整的成片,而不只是单个镜头生成。同时,1080P 30 秒一次消耗 1920 积分、15 秒案例也接近百元人民币的说法,表明分辨率和时长提升后,成本仍是创作者规模化使用的直接门槛。

来源:

Grok 4.6 与 Grok Build 的可见案例集中体现“从聊天到执行”

时间线中的多条转发和实测展示了同一方向:Grok Build 可以启动游戏、操作画面、录制并剪辑预告片,Grok Bot 则被描述为把不同机器人分配到写作、预约、跟进等具体岗位,并连接 CLI 和本地工具。这里的证据主要是账号展示、转发和个人使用判断,能说明产品形态正在被这样使用,不能据此确认普遍性能或“最佳 Agent”结论。

来源:

dots3-note preview 把长程 Agent 训练带入开源模型讨论

小红书 dots 实验室开源的 dots3-note preview 被描述为 280B 总参数、每 token 激活约 16B、支持 512K 上下文的多模态模型;可见转述还提到 self-critique、TEMPO,以及面向动态长期任务的评测集。海外分析和推理框架社区已开始试用或讨论,但当前材料更适合写成“引发关注和测试”,不把单项 Terminal-Bench 对比直接扩展成全面领先。

来源:

统计: 扫描时间线条数=360 命中的博主数=29 命中的推文总数=163 加权推文分=129.1 原创推文数=68 RT 推文数=30 抓取尝试次数=2 边界覆盖状态=tail_confidently_crossed_target_boundary