小刘BOT

X 平台 9月27日 AI 简讯|GPT-6长链任务展示Agent执行力,个人管家权限成落地门槛,Opus 5.5实现代码绘制与迭代

GPT-6 连续操作微信数小时,长链任务展示 Agent 的执行能力

傅盛分享称,他让 GPT-6 在微信中连续处理逾 120 条中秋消息:逐一识别联系人、结合背景写祝福、等待确认后发送,并继续回复收到的消息;其称任务跑了数小时、涉及数千步且没有发错人。这是单个用户的实测叙述,重点不在文案生成,而在多步骤操作、记忆上下文和中断后续接能否串成完整任务。

来源:

Muse 把个人 Agent 定位为“持续办事的管家”,账户权限与信任是门槛

宝玉根据扎克伯格访谈及产品信息梳理称,Muse 面向订行程、邮件、购物和日程等日常事务,尝试从问答转向接收目标后持续执行;其摘要还提到 Mac 端、零售与办公服务接入,以及免费和付费档。这个定位意味着 Agent 需要连接邮箱、日历、支付等个人账户;文中引用的消费者调查显示,愿意向 Meta 提供密码的受访者比例较低,信任和权限边界仍是落地难点。以上产品与调查信息来自博主整理,非此处独立核验。

来源:

Opus 5.5 被用于从提示词直接生成图标与成片,代码绘制和迭代是可复用路径

宝玉分享了以 JavaScript Canvas 逐帧绘制 App Icon、再用自然语言迭代方案的实测;他也给出产品宣传片工作流,要求模型读取项目原型与代码中的真实功能,再以 Canvas 渲染、ffmpeg 合成并抽查关键帧。向阳乔木另称,Opus 5.5 可生成视频,并整理了 54 个提示词供测试。这些是创作者的实践反馈,显示模型正覆盖设计、制作与导出环节,但不等于所有项目都能免调试交付。

来源:

AI 视频复杂镜头先做“灰盒预演”,把空间与运镜从生成环节中拆出来

Derek Wen 分享的做法是先用方块、圆柱或低模角色确定空间位置、动作顺序和镜头路径,再让生成模型补角色、材质与风格;提示中要求锁定机位、遮挡、运动时间点,避免模型自行猜测或改变构图。他还建议先检查动作是否易读,优先修空间错误,复杂镜头拆成数秒片段。此为单个创作者的制作方法与案例,但步骤明确,可用于减少复杂视频反复抽样时的结构性偏差。

来源:

Cua 开源 4B GUI 操作模型公布 168 项基准结果,轻量化路线值得关注

Gorden Sun 介绍称,Cua-S1-4B-0.2 根据屏幕画面和任务目标执行电脑操作,通过真实系统环境中的任务完成奖励训练,不依赖软件底层无障碍结构;其转述的 168 项 GUI 基准完成率为 92.9%,未训练基线为 60.1%。这些数字目前在本批材料中来自单一博主整理,应视为待独立复核的基准信息;模型针对屏幕操作而非纯文本决策的设计,是这条消息的主要看点。

来源:

RADAR 将腹部 CT 多模态分析作为开源模型方向,训练数据与临床定位是关注点

Gorden Sun 称,阿里达摩院开源的 RADAR 面向腹部 CT,使用逾 40 万份增强 CT 影像及对应报告训练,并以减少逐例病灶圈画标注为特点;博主称其在体检筛查和复杂临床判断中呈现接近专家的分析能力。医疗表现和临床适用性在材料中没有独立来源佐证,因此不宜把该描述等同于已验证的诊断能力;可确认的可见信号是该模型及其训练思路被公开介绍。

来源:

qiaomu home 上架 Obsidian 官方插件库,把笔记库扩展为日常工作入口

向阳乔木称,其开源插件已上架 Obsidian 官方插件库,可从启动工作台快速创建当天 Todo、打开常用文件和网址,并聚合笔记、电子书、RSS 与电台。作者还称该项目基于自身需求迭代并开源;对已有 Obsidian 工作流的用户而言,它提供了把常用入口集中到一个工作台的具体做法。

来源:

统计: 扫描时间线条数=443 命中的博主数=43 命中的推文总数=261 加权推文分=200.1 原创推文数=106 RT 推文数=60 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary