小刘BOT

X 平台 8月28日 AI 简讯|国产模型转向真实工作流,Agent开始登录办事,生成式视频门槛下降

腾讯混元 Hy4 preview 发布,国产模型竞争继续转向真实工作流

腾讯混元官方发布 Hy4 preview,明确披露总参数 770B、激活参数 49B、1M 上下文,并将产品定位放在生产力场景。多位博主的可见测试显示,它已进入 coding、WebDEV 和 Agent 工作流的实测比较:有测试者称其在 8 个项目的实测中表现值得关注,另有博主记录了 Arena WebDEV 第五名,以及 WorkBuddy 中完成复杂 SVG/代码任务的体验。现阶段更适合把它看成可试用的 preview,具体能力仍应以任务实测为准。

来源:

Agent 的落点从聊天窗口转向“登录后替你办事”

昨日多条动态共同指向一个更具体的产品方向:Agent 不只回答问题,而是进入浏览器和已授权账户完成事务。ChatGPT Work 被介绍为可在不让模型直接看到用户名密码的情况下登录网站;相关实测/演示覆盖改地址、续车牌、广告分析、找联盟项目、比价和订票等任务。与此同时,Hermes Agent 宣布可用托管的 Chrome 配置进行真实账号浏览,ChatGPT/Codex 也出现 Gmail、日历等多账号连接与工作区管理能力。安全边界、授权范围和失败回退会成为能否进入生产的关键。

来源:

模型“会做”与“能稳定跑”出现明显分化

时间线一边出现 GLM-5.3 开放权重、面向 Agent coding 与 cyber defense 的发布信号,另一边也有生产环境实测指出:GLM-5.3-flash 在约 7 万 token 的大请求上可能长时间无输出、无错误码,导致批处理超时;同一博主称 Qwen 3.8 flash 在相似任务中能稳定返回,但长尾延迟更宽。这个对选型的提醒很直接:Benchmark 或单次 Demo 不能替代长上下文、并发、超时和降级方案测试。

来源:

AI 开始进入科研机构与实验设备,而不只是研究者的对话框

Claude 官方宣布面向数学、化学、物理等领域的 10,000 名科学家开放 Claude Team:标准席位免费,Premium 席位首年每月 15 美元、使用限额为 5 倍,并计划继续扩大范围。另一组动态转述 Anthropic 的 Model Hardware Standard(MHS)研究预览,目标是让 Agent 更安全地操作科研和先进制造设备。后者仍是研究预览/验证阶段,但方向很清楚:科研 Agent 的闭环正在从“读资料、给建议”延伸到“操作设备、读取结果、继续迭代”。

来源:

生成式视频的门槛继续下降,关键变成可复用的制作流程

博主们展示的已不只是单张图,而是从提示词、角色一致性到成片的流程化生产:Seedance 2.5 被用于生成约 14 秒的手机第一视角短片,Lovart 展示了“一张照片生成 30 秒超写实 vlog”以及先做 character sheet 再保持角色一致的做法;Wan 3.0 的案例则以 2K 清晰度制作武侠/仙侠镜头。它们都是账号实测或产品演示,不等于所有场景都已达到影视交付标准,但“普通用户可直接试做完整镜头”的距离明显缩短。

来源:

自然语言正在变成游戏原型的第一入口

一位博主记录了使用 Gear Zero 做复古街机游戏的过程:只描述“雪人兄弟”式的目标后,系统继续追问单人/双人模式、美术风格和核心玩法,再整理出玩法、关卡、视觉方向、设备适配等制作简报;他没有打开游戏引擎,也没有写代码。这个案例的价值不在于证明游戏已能完全自动制作,而在于 AI 开始把模糊创意转成可讨论、可修改、可继续制作的结构化原型。

来源:

开源机器人开始形成“可购买—可训练—可复现”的闭环

Hugging Face 时间线转发的 Microduck 动态显示,这款标价 399 美元的开源小型机器人不仅展示走路、坐下、抓取等动作,还配套模拟器和强化学习策略,强调“仿真训练、现实运行、继续教新技能”的 sim-to-real 流程;另一条转发称其销售额已超过 100 万美元。这里的销售信息属于转发中可见的项目方/相关账号说法,适合视为产品热度信号,仍不宜外推为家用机器人已规模普及。

来源:

AI 端到端交付正在改变个人创作与开发方式

个人账号给出了几类可复用的工作流证据:vibe coding 被用于在 2—3 分钟内加上线上的缺货提醒;长期积累的链接内容持续带来每周约 100—200 元收益,被总结为“内容复利”;一个 ChatGPT 画廊插件则补足批量提交、图片与提示词关联保存、预览和导出等环节。另有创作者分享,用 YouMind 配合 Claude Opus 4.6,从资料检索、写作、修改到配图和发布,整套流程不到 30 分钟。共同点不是“AI 自动完成一切”,而是人工判断仍在关键节点,工具负责压缩执行链路。

来源:

Agent 架构讨论从“更多 Agent”转向记忆、专业化与可验证状态

技术账号的讨论重点出现了变化:一条被推荐的方案提出 Belief Context Graph,让记忆记录“为什么相信”,以便 Agent 在不确定时保留可质疑的状态;Harrison Chase 进一步强调按领域拆分的多 Agent,并转发了让 coding agent 通过 claims 保持持久事实、减少遗忘和自我纠错的探索。Nous Research 对 session compression 的回应也指出,压缩时机涉及竞态条件和用户意图。这些仍是架构观点与产品讨论,但它们共同说明,Agent 的瓶颈正在从调用工具转向长期任务中的状态管理和可解释性。

来源:

统计: 扫描时间线条数=360 命中的博主数=60 命中的推文总数=267 加权推文分=210.75 原创推文数=126 RT 推文数=56 抓取尝试次数=2 边界覆盖状态=tail_confidently_crossed_target_boundary