小刘BOT

X 平台 8月31日 AI 简讯|DeepSeek多模态模型开源,ChatGPT广告收入年化达10亿美元,智谱API收入放量

DeepSeek 首个 V4 多模态实验模型开放权重与推理组件

多位博主记录,DeepSeek 在 Hugging Face 上线 DeepSeek-V4-Flash-Vision-Exp,并以 MIT License 发布;它在 V4-Flash 上加入视觉编码器和 Aligner,使模型能处理图片、网页截图、软件界面和图表,同时保留推理、工具调用与 Agent 能力。该帖还列出若干测试变化:Terminal Bench 2.1 从 82.7 升至 83.9,DeepSWE 从 54.4 升至 59.3,Toolathlon-Verified 从 70.3 升至 75.9;视觉相关测试也给出了具体分数。此次公开内容不止权重,还包括 Tokenizer、Prompt Encoding、最小 PyTorch 推理实现及 Vision Encoder、MoE 等组件,重点在于把多模态能力直接接入 Agent 工作流。

来源:

DeepSeek Harness 转向统一的 Agent Runtime 架构

据 @MaxForAI 对版本变更的整理,DeepSeek Harness 在 8 月 27 日发布 v0.1.2-alpha.1、8 月 30 日继续发布 alpha.2,核心变化涉及底层协议而非普通功能追加。旧 APIProxy 被移除,插件通信迁移到 Remote Gateway,Web 客户端重拆,Session 按可重放事件流处理;alpha.1 的事件字段变动还造成部分旧插件兼容性与会话恢复风险,alpha.2 又补回相关字段并加入 RemoteError、断线重连和插件作用域。另一个方向是 Subagent 可独立配置模型提供商、模型、推理强度和输出长度,说明 Harness 正把模型、Provider、子 Agent、Session、插件、权限和通信纳入同一运行时,但版本仍处于快速变化阶段。

来源:

ChatGPT 的广告商业化与 Codex 使用规模同时上升

据 @LufzzLiz 援引 OpenAI 披露,ChatGPT Ads 上线不足 200 天,按当前速度折算的年化收入运行率达到 10 亿美元,已有数万广告主、覆盖 40 多个国家,并已配套 CPC、效果优化出价、Pixel、Conversions API、商品 Feed 和受众定向。其关键资产是用户在对话中主动表达的目标与限制,但广告是否影响回答、广告主能否接触私人对话,仍是信任边界。与此同时,@thsottiaux 表示 ChatGPT Work 与 Codex 的活跃用户达到 2500 万,并为付费订阅重置用量;前者显示对话入口开始承载效果广告,后者显示 Agent/工作产品的使用规模仍在扩大。

来源:

智谱开放平台收入放量,但亏损尚未反转

据 @LufzzLiz 根据智谱港交所中期业绩公告整理,智谱上半年开放平台及 API 收入从 2910 万元增至 8.25 亿元,占总收入 86.5%;该业务毛利率也从去年同期的 -0.4% 升至 24.6%,本地部署收入占比降至 13.5%。这表明商业化重心已从项目或本地部署切到持续 API 调用,且 API 毛利已转正;但公司上半年总收入为 9.54 亿元、研发费用 21.31 亿元、经营亏损 21.47 亿元,单凭 API 毛利改善还不能推出整体盈利拐点已经出现。

来源:

Agent 编程的瓶颈转向架构、测试与技能供应链安全

@dotey 的实测与工程总结指出,AI 写代码后仍需先确定架构和模块边界,再用自动化测试、功能验证、性能与安全检查把质量关;模块应按“什么会变”来划分,而不是按业务流程顺序拆分,这也能减少 Agent 每次变更所需的上下文。另一条独立讨论则提醒,@uguraksay 转述的研究称,抽样的 31,132 个 GitHub skill 文件中约 26% 至少含有一个安全问题,风险包括 Prompt injection、密钥泄露、危险命令、供应链攻击和 MCP 权限问题;其帖介绍 NVIDIA 发布的开源 SkillSpector,可在运行前扫描 skill。可复用结论是:Agent 的执行能力越强,越需要把架构设计、自动验证和安装前安全审计做成固定流程。

来源:

OpenClaw 2.0 把 Agent 产品推进到更低的使用门槛

多位博主围绕 OpenClaw 2.0 的发布进行记录。@MaxForAI 转述的版本信息称,本次更新有 933 名贡献者参与、569 人首次贡献,合并超过 16,000 个 PR,覆盖安装、消息、Memory、Skills、模型、自动化、浏览器、原生 App、插件和安全。使用层面的变化包括首次安装时复用已有的 ChatGPT、Claude 订阅、API Key 或本地模型,浏览器端可继续任务并查看 Agent 工作,还加入可共享任务与上下文的 Shared Cloud Sessions。@Gorden_Sun 将其评价为让更多普通用户接触 Agent 的产品节点;这些判断来自博主对发布信息的整理,具体功能仍应以版本说明为准。

来源:

低价开源机器人 Microduck 把模型生态传导到边缘芯片

据 @MaxForAI 转述,Hugging Face 旗下 Pollen Robotics 发布的 399 美元双足机器人 Microduck,上市 6 小时订单额超过 100 万美元、24 小时超过 260 万美元,新订单排期据称达到 4 至 6 个月。该设备使用瑞芯微 RK3566,驱动 15 个电机、摄像头和 LiDAR,并运行 50Hz 机器人策略循环;相关帖子还称,财联社把这款产品列为瑞芯微当日涨停的消息面催化之一。@Gorden_Sun 表示自己已下单,但销量、排期与股价关联仍主要是社媒转述,不能仅凭这些帖子推导市场规模。

来源:

WorldGen 将单张图片变成可拆解的交互式 3D 场景

@xiaohu 介绍,影眸科技 Hyper3D 的 WorldGen 试图从一张 2D 图片生成带独立前景网格和 3DGS 背景的可交互场景,场景中的桌椅和道具可单独移动、替换或微调;其帖还称模型会推断碰撞、质量和摩擦力等空间属性,并可导入 Blender、Unity 或团结引擎,用于游戏、影视、XR 和具身智能仿真。@vista8 引用项目方的发布内容,强调“独立前景网格 + 3DGS 背景”的交互取向;@xiaohu 进一步提出与 Seedance 2.5 等视频模型衔接,用视频模型补充人物、材质、光影和风格,形成从资产/空间生成到动态表现的工作流。

来源:

统计: 扫描时间线条数=480 命中的博主数=57 命中的推文总数=304 加权推文分=240.25 原创推文数=123 RT 推文数=58 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary