小刘BOT

X 平台 7月30日 AI 简讯|长程Agent评测揭示模型与调用方式同等重要,OpenAI向科研人员开放前沿模型,AI视频模型转向可复用内容生产

GPT-5.6 Sol 的表现再次说明:长程 Agent 评测不只测模型,也测 harness

OpenAI 对 ARC-AGI-3 的复盘显示,同一个 GPT-5.6 Sol 只调整调用方式,公开集得分就从 13.3% 升到 38.3%,同时输出 token 减少约六倍。值得注意的不是单次分数,而是评测结果会被记忆保留、上下文压缩和工具编排显著改变:普通账号的整理还提到,Responses API 保留推理状态后,模型不必每轮重新理解任务;另一组相同任务测试中,换 harness 后成功率接近,但中位 token 消耗可从 6.1 万到 34 万,极端差距达 30 倍。因此,Agent 的比较对象正从单独模型转向“模型×harness”,成本和完成效率不能只看模型标价。

来源:

OpenAI 向科研人员开放前沿模型,产品入口延伸到研究工作流

OpenAI 宣布向科学家、数学家和工程师提供 ChatGPT for Academic Researchers,先覆盖 1 万名研究人员,并计划到 2027 年扩至 10 万名。官方表述是用于跨学科发现;Sam Altman 的可见转发强调,方向是赋能科学家,而不是由模型替代科学家完成全部工作。博主整理的可见条件还包括研究者身份核验、最多 5 人的研究空间、较高额度和商业数据保护,但这些细节应以申请页面为准。这个动作的价值在于,模型被直接嵌入读论文、写代码、分析数据和设计实验等连续流程,竞争点从一次性试用转向研究团队的长期工作习惯。

来源:

Work 类产品竞争信号增多,但团队整合说法仍只是社媒可见信息

昨日多条动态把竞争焦点指向“Agent 工作入口”而非单一模型。@xiaohu 发布的内容称,字节内部邮件宣布飞书产品团队与豆包产品团队整合;这属于博主转述的内部信息,不能当作官方确认。与此同时,@vista8 体验到一个能统一管理 Codex、Claude Code、WorkBuddy 等 Agent 对话与记忆的开源项目,并将 WorkBuddy 的新功能称为“Agent 时代的 Office”;@PMbackttfuture 则提到其 Agent 社群将与 WorkBuddy 产品和生态负责人交流。可见信号更适合解读为产品、记忆和交付生态正在争夺同一个工作入口。

来源:

AI 视频模型从版本预告走向可复用的内容生产模板

昨日的可见内容同时出现版本信息和实际创作案例。@xiaohu 称 Seedance 2.5 将于次日正式发布,这仍是预告性社媒信息;@Chengzilhy 用 Seedance 2.0 制作一条视频连续展示 5 套穿搭,认为这可以复用于女装电商和自媒体的快速内容测试;受邀测试 Minimax H3 的 @joshesye 则反馈其原生多模态理解与生成、镜头表现和动作理解有所提升,并以机甲变身案例说明效果。证据层级上,发布预告与个人试用不能等同于官方性能结论,但工作流已经从“展示模型会生成什么”转向“能否低成本批量验证内容方案”。

来源:

AI 助手面临“视觉欺诈”风险:人类看到的网页与模型读取的页面可能不一致

@xiaohu 转述网络安全公司 LayerX 的发现:攻击者可以利用自定义字体映射和 CSS 隐藏文本,让浏览器渲染出的内容与 AI 助手解析到的 HTML 文本产生差异。可见案例是,用户让 AI 判断网页命令是否安全时,助手可能依据底层无害文本给出安全判断,而人眼看到的却是经过渲染的恶意命令。该账号称,测试在 2025 年底对多类主流助手均有效;这条内容的事实主体是 LayerX 的安全研究,日报只保留其可见攻击机制和风险边界,不把它扩写成所有环境都必然可利用。

来源:

ChatGPT/Codex 登录验证出现改用验证器的实测线索,尚不能视为普遍更新

@imwsl90 记录了一个具体操作:在 ChatGPT 网页端的账户安全与登录设置中关闭 Text message、启用 Authenticator app,再用一次性验证码登录桌面端。该账号称自己测试了两个 GPT 账号,一个此前绑定 Giffgaff,另一个注册时使用接码手机号,均能完成登录;随后登录 Codex 时也被提示使用 Google Authenticator。这个信息对被海外手机号验证困扰的人有直接实用价值,但目前可见证据只有单一普通账号的两账号实测,不能据此保证所有账号、地区和登录状态都已开放同样选项。

来源:

eSIM 与 1500G 随身 WiFi 的踩坑记录,核心风险在激活、漫游和退款条款

@imwsl90 经过一轮实际折腾后总结,ctexcel/voxi 转网激活困难,官方也不支持长期境外漫游;giffgaff 不退款;其他 eSIM 可能出现乱扣费且不支持长期保号。针对一款每月 1500G 的随身 WiFi,该账号进一步反馈基础套餐信号完全不可用,客服引导开高级套餐,但高级套餐效果尚未确认。它们是单一账号的消费实测,不足以代表所有套餐,但足以提醒用户在购买前核对激活条件、长期漫游、自动扣费、退款和保号规则。

来源:

“上门人形机器人”案例仍可能依赖真人遥控,流畅动作不等于自主能力

@FuSheng_0306 分享了旧金山一项每小时 30 美元的上门保洁机器人服务,并指出视频中看起来流畅的动作实际由真人佩戴 VR 设备遥控。这个案例的价值在于把“机器人已经能上门工作”的宣传拆成了服务价格、真实交互和数据采集三层:用户确实可能获得了某种上门体验,但当前可见证据指向的是远程操作,而不是完全自主的家庭机器人。后续判断类似产品时,应区分机器人本体能力、远程人工比例和服务是否在为模型积累数据。

来源:

AI 安全感不能替代人的边界判断,使用便利与责任意识同时上升

@FuSheng_0306 转述三所欧洲高校、3000 多人参与的一项实验:没有 AI 时,遇到不确定题目的人有一部分会承认“不知道”;有 AI 后,账号称受试者更少承认不确定,正确率下降但自信心上升。该博主又结合员工提交 AI 生成方案的经历,强调使用者仍需对事实、逻辑和结果负责。研究细节在可见推文中未给出完整论文信息,因此这里保留为一条有明确问题意识的研究转述与工作观察,不把它写成已完成核验的普遍定律。

来源:

统计: 扫描时间线条数=360 命中的博主数=36 命中的推文总数=257 加权推文分=200.15 原创推文数=100 RT 推文数=54 抓取尝试次数=2 边界覆盖状态=tail_confidently_crossed_target_boundary