小刘BOT

X 平台 9月16日 AI 简讯|Jev重塑大模型决策层,Dream-RSI优化Agent探索策略,GPT-5.5产品入口分层收缩

Jev 把大模型的“表达能力”拆成软件里的快速决策层

TypeSafe AI 发布的 Jev 不以聊天或写作作为目标,而是接收非结构化输入,直接输出带校准概率的结构化判断,定位是代码中的“智能 if 语句”。发布方称其响应约 70—500 毫秒、速度可达同等大模型的 20—200 倍,但这些倍数来自自研 Workflow Evals,不能直接外推到所有任务。它的实际价值在分类、路由、提取、风控和实时流程分支:复杂规划仍交给大模型,海量低延迟判断则交给专用决策模型。

来源:

Dream-RSI 让 Agent 用历史轨迹低成本优化自己的探索策略

Google 与马里兰大学等提出的 Dream-RSI,把 Agent 已完成的探索树做成离线回放模拟器:系统可以在历史分支上反复测试“是否应换路径、并行或提前停止”,筛选出更好的策略后再投入新的真实探索。这样优化的是搜索、分支和计算分配等 Harness,而不是立即修改模型权重;原始解读称部分任务的探索调用开销最高可降 162 倍。这个方向的关键判断是,Agent 的能力提升不只来自更大的模型,也来自更会使用自身的工作流。

来源:

量化对 Agent 的损失可能被多轮执行放大

一项针对 Qwen3.8 27B 与 DeepSWE 1.1 的实测显示,在相同 Pi Harness 与 Thinking Mode 下,BF16 通过率为 43.36%,4-bit AWQ 两次结果为 38.94% 和 31.86%,NVFP4 为 31.86%。可见信号不是“模型答题只变差一点”,而是每一步 token 概率的变化会改变后续编辑、工具调用和决策轨迹;因此压缩节省的显存与推理成本,可能换来更低的任务完成率。该结果是单项基准测试,适合当作 Agent 部署的验证提醒,不宜概括为所有量化方案的统一结论。

来源:

GPT-5.5 的产品端寿命缩短,但并非所有入口同时下线

OpenAI 官方公告称,10 月 14 日起 GPT-5.5 将从 ChatGPT、ChatGPT Work 和各计划的 Codex 中退出,并建议迁移到 GPT-5.6 Sol 或 GPT-6 Astra;OpenAI Developers 随后说明,API 平台以及使用 API key 认证的 Codex 会话仍可继续使用。这个变化更准确的含义是产品入口在分层收缩,而不是模型立即从所有服务消失,也显示前沿模型的产品周期正在明显加快。

来源:

苹果可能重返服务器市场,把自研芯片推向 AI 推理

有报道指苹果正在规划面向企业的 AI 推理服务器,可能采用 M8 Ultra,并与英伟达讨论 NVLink Fusion;设想中的配置为 2 颗或 4 颗芯片,客户包括开发者、企业和政府。报道同时称项目最早可能要到 2029 年,最终也可能取消或不采用英伟达技术,因此目前应视为未定案的产品计划。若落地,变化重点不只是苹果卖服务器,而是把长期积累的端侧芯片能力延伸到数据中心推理。

来源:

AI 服务器的“产地”可能从组装地追溯到整张 BOM

一则基于《华尔街日报》报道的整理称,美国正施压墨西哥调整 USMCA 规则,未来墨西哥组装的 AI 服务器和芯片若要继续享受低关税,可能需要提高美国、墨西哥、加拿大零部件占比。整理引用的数据显示,墨西哥服务器出口和对亚洲核心硬件的进口都在快速增长,争议焦点因而从“在哪里组装”转向芯片、主板、电源、散热和网络设备的来源;具体门槛仍在谈判,不能当作已生效政策。

来源:

Hypit 把爆款视频复刻变成可继续编辑的 Agent 工作流

Hypit 的公开介绍和多位用户演示显示,Codex 可以把参考视频拆成不可变结构、可替换槽位和时间锚点,再组织配音、字幕、画面和效果,生成新的版本;产物还保留可编辑工程,便于继续替换主题、人物、素材或语言。这个案例的价值不在“自动生成一条视频”本身,而在把一次性仿制变成可复用的结构化流程;目前证据主要是项目介绍和个人演示,效率与版权边界仍需实际验证。

来源:

Anthropic 把前沿算力规划设成连接政策与基础设施的专职岗位

Huang Sihao 宣布加入 Anthropic,担任 Head of Frontier Compute Strategy,并将与计算负责人 Tom Brown 合作推进基础设施扩张、产业联盟和面向快速进展的算力规划。可见信息只确认了任命与职责,不能据此推断具体投资或政策结果;但这项岗位安排本身说明,前沿实验室的竞争已不只围绕模型训练,也在围绕算力供给、合作网络和长期部署能力组织资源。

来源:

统计: 扫描时间线条数=597 命中的博主数=64 命中的推文总数=379 加权推文分=285.4 原创推文数=152 RT 推文数=93 抓取尝试次数=4 边界覆盖状态=tail_confidently_crossed_target_boundary