小刘BOT

X 平台 8月26日 AI 简讯|国产模型开源新架构,OpenAI自研芯片实测,Agent开始代用户完成网页事务

GLM-5.3-Flash 正式开源,国产模型把能力、价格与国产算力同时推向前线

昨日,智谱正式发布并开源 GLM-5.3-Flash,并确认此前以 Ox Alpha 形态被关注的模型归属。值得关注的不是单一跑分,而是它把原生多模态、长上下文、低价格和国产芯片部署放在了同一条产品叙事里。

  • 官方公告将模型定位为原生多模态、支持 1M token 上下文的 Flash 模型;博主整理的可见信息显示,总参数约 320B、激活参数约 18B。
  • 公开转述的限时价格为输入 0.4 元、输出 1.4 元/百万 Tokens;即使恢复到 0.8/2.8 元,仍明显低于文中对比的 DeepSeek V4-Flash 高峰价格。
  • @Gorden_Sun 转述称,Ox Alpha 过去一周的大规模调用全部使用国产芯片;这属于智谱及博主可见的发布信息,后续仍应以更多实测和官方材料核验。

来源:

Qwen3.8-Flash-Next 作为 Qwen4 架构预览开源,低激活参数成为新路线

阿里昨日发布 Qwen3.8-Flash-Next,并明确将其定位为 Qwen4 之前的架构预览。它把“总参数更大、每个 Token 实际激活更少、上下文计算更便宜”作为核心方向,说明开源模型竞争正在从单纯堆规模转向架构和推理成本。

  • 可见资料显示,该模型采用多模态 MoE,主模型约 125B 参数、每 Token 激活约 6B,原生上下文 262K,并可通过 YaRN 扩展到 1M。
  • Qwen 官方给出的后续 API 价格为输入 0.16 美元、输出 0.47 美元/百万 Tokens;博主转述称其训练成本约为 Qwen3.7-Plus 的九分之一,并重点强化 Coding 与办公 Agent 场景。
  • GDN+QSA 混合注意力、Gated Residual、N-gram Embedding 和 Muon 优化器被列为架构升级点;正式规格和实际效果仍需要模型卡与独立测评继续确认。

来源:

OpenAI 自研 Jalapeño 推理芯片进入实测,算力竞争转向每瓦产出

OpenAI 昨日公布 Jalapeño 的实测进展,并计划在年底开始把它部署到自有计算基础设施。对模型公司而言,这意味着竞争边界继续向芯片、能效和供应能力延伸,而不只是模型本身的能力。

  • OpenAI 将 Jalapeño 描述为首款自研推理芯片,目标是同时提高每瓦智能产出、吞吐量和响应速度。
  • @derrickcchoi 转述的可见测试信息称,在三种模型上,Jalapeño 相对对比芯片的每千瓦吞吐量约高 54 至 104 倍;这一数字属于公开发布后的工程师转述,仍应结合完整测试条件理解。
  • OpenAI 计划今年年底开始部署,第二代已在开发,第三代也已启动规划;@Gorden_Sun 还提到从设计到制造约耗时 9 个月,显示 AI 辅助硬件研发也是该项目的一部分。

来源:

WebMCP 接入 ChatGPT 桌面浏览器,网站开始拥有面向 Agent 的工具接口

OpenAI Developers 昨日宣布在 ChatGPT 桌面应用内置浏览器和 ChatGPT Sites 中支持 WebMCP,并发起为期 10 天的 WebMCP Challenge。可见变化是:网站不再只为人提供页面,也可以把可调用能力直接暴露给 Agent。

  • 兼容网站可让 ChatGPT 或 Codex 自动使用其工具完成任务,开发者也可以让 Codex 创建并部署 WebMCP 应用。
  • 挑战赛联合 Chromium、Cloudflare、Shopify、Vercel、Render 和 Netlify,奖金总额为 3.5 万美元,并配套 Codex、ChatGPT Pro 等奖励。
  • OpenAI 还公布了 Build Week 的 8 个获奖项目,其中 Sentinel 用静态分析、GPT 审查和 Docker 沙箱检查 MCP 服务器安全风险,体现了 Agent 工具链的安全问题已经进入产品实践。

来源:

ChatGPT Work 开始支持安全登录,Agent 从“给建议”走向代用户完成网页事务

ChatGPT Work 昨日开放网页和移动端登录能力,允许 Agent 在用户提供的安全登录表单和持久化会话基础上完成订购、取消订阅、预约等端到端任务。关键产品信号是,Agent 正在获得持续身份和电脑界面,但凭证控制仍被单独设计。

  • 公开说明称,用户可让它处理水电开通、退货预约等需要实际点击操作的任务;登录凭证不会被模型直接看到。
  • @JamesZmSun 介绍了安全登录表单、自动检查目标字段、密码管理器和 2FA 消息接入,以及按站点清理 Cookie 等控制项。
  • 这类能力扩大了 Agent 的实际行动范围,也把误操作、权限边界和可撤销性从“体验问题”提升为必须解决的安全问题。

来源:

Apodex 1.1 把深度研究推进到可执行、可恢复、可核查的 Agent 流程

昨日多位博主分享了 Apodex 1.1 的实测和开源信息。它试图解决的不是“搜到更多资料”,而是让复杂研究任务从原始文件走到可检查交付物,并在失败、变化和多子任务并行时保持流程连续。

  • Gorden_Sun 介绍的流程包括先核查用户输入事实,再启动多个子 Agent 并行研究、交叉验证,最后进行整体报告和终审;项目同时开源 35B 本地模型 Apodex 1.1 mini 与 FrontierAgent 框架。
  • Xiaohu 转述称,单个任务最高可调度 150 个子 Agent,并支持失败后调整执行路径继续工作;这类长任务能力更适合科研、分析和专业调研,但执行时间较长。
  • Vista8 的实测覆盖长篇课程、Linux 手册、插件白皮书和 CSV 数据分析,并称可看到执行链路和中间产出;这些是用户实测,不等同于独立基准结论。

来源:

Gear Zero 让自然语言直接进入浏览器小游戏创作,Agent 开始承担完整制作链

多位博主昨日展示 Gear Zero 的游戏生成过程:用户只描述一个想法,系统便负责规划、写代码、绘制素材和构建关卡,并产出可直接在浏览器试玩的版本。它的价值在于降低从创意到可玩原型的门槛,而不只是生成一张概念图。

  • @cellinlab 以“天空之城版绝地求生”为例,记录了从一句提示词到 V1 可玩的过程,并展示后续可迭代的空战、城市场景和决赛圈方向。
  • @LufzzLiz 分享的体验中,《是兄弟就来砍我》约 20 分钟出现首个浏览器版本;Deep Mode 可围绕同一游戏持续工作最长 10 小时,也支持多人共同修改。
  • 这些内容主要是博主实测与产品展示,能证明创作链路可运行,但不能据此推断游戏质量已达到商业产品水平。

来源:

OpenWorker 将本地可审计 Agent 用于漏洞、依赖和云配置检查

Andrew Ng 昨日介绍 OpenWorker 新版本,重点不在聊天,而在让 Agent 直接完成电脑上的安全工作。项目把模型与开源 harness 分开,允许安全团队审计执行层,并可选择本地模型处理敏感代码。

  • 新增能力包括扫描代码漏洞、检查依赖供应链注入,以及发现云安全配置中的攻击面。
  • 公开说明称,用户可以运行本地开放权重模型,让敏感代码不离开设备;也可以接入 ChatGPT、Ox Alpha 或其他 API 模型。
  • 这类“shift left”工作流把 AI 安全能力前移到部署前,但项目介绍本身不等于安全效果的独立评测,实际使用仍需验证误报、漏报和权限边界。

来源:

统计: 扫描时间线条数=480 命中的博主数=50 命中的推文总数=290 加权推文分=237.65 原创推文数=132 RT 推文数=45 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary