DeepSeek 视觉模型从代码线索转为 API 可用,低价多模态 Agent 进入实测阶段
DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API Platform 上线,值得关注的不只是新增图片输入,而是它直接接入了长上下文、工具调用和 Agent 工作流。可见信息显示,该实验模型有 1M 上下文、最高 384K 输出,支持 Tool Calls、Responses API、Anthropic API、JSON Output,并发限制为 2500;图片按尺寸折算 Token,价格与 V4 Flash 相同,缓存命中输入低至每百万 0.05 元(空闲时段),输出为每百万 4.5 元(空闲时段)。DeepSeek Harness 已跟进支持图文输入和文件 API,也有博主实测用它复刻网页。性能比较目前主要来自官方说明和社媒体验,不能把“接近某旗舰模型”当成独立基准结论。
来源:
- @deepseek_ai: https://x.com/deepseek_ai/status/2090730032574631962
- @MaxForAI: https://x.com/MaxForAI/status/2090730253782229374
- @aiwarts: https://x.com/aiwarts/status/2090765209199869998
- @balconychy: https://x.com/balconychy/status/2090765308818813178
匿名模型 Ox Alpha 引发强编码能力信号,但身份与基准结果都未确认
Ox Alpha 通过 OpenRouter 和 OpenCode 匿名内测并开放使用,公开描述包括 1M 上下文、原生多模态、面向编码和持续 Agent 工作,社媒还提到免费和零数据保留。可见测试中,10 个 DeepSWE 任务得到 8/10,但样本很小;随后社区扩大测试给出约 63%,仍属于博主转述和社区结果。模型身份目前有小米 MiMo、智谱 GLM 等猜测,Token 数特征和产品接入关系被用作线索,却没有官方确认。现阶段更可靠的结论是:一个匿名模型已经获得了多位开发者的试用和认可,不能据此确认它的厂商或全面领先。
来源:
- @OpenRouter: https://x.com/OpenRouter/status/2090544970923184269
- @MaxForAI: https://x.com/MaxForAI/status/2090783750217162788
- @Khazix0918: https://x.com/Khazix0918/status/2090650993268752744
- @vista8: https://x.com/vista8/status/2090825860861636646
Codex 额度争议暂未被官方定性为普遍削减,官方先确认 2000 万活跃用户并发放重置
Codex 负责人 Tibo 表示,本周活跃用户已达到 2000 万,并向 Codex 与 ChatGPT Work 用户发放一次可自行使用的 Banked Reset。针对额度消耗变快的反馈,官方说目前没有发现异常,仍在调查;同时明确指出,把订阅额度转成 API 流量再转售或共享的 sub2api 用法不受支持,可能触发反欺诈系统,而通过官方客户端或支持 Sign in With ChatGPT 的开源客户端使用订阅额度属于正常方式。社区确有多位用户报告 Pro 额度下降、单次任务消耗异常,但这些是个人实测或转述,当前证据支持“存在争议并正在调查”,还不足以写成 OpenAI 已确认对所有订阅用户统一降档。
来源:
- @thsottiaux: https://x.com/thsottiaux/status/2090675027670978569
- @thsottiaux: https://x.com/thsottiaux/status/2090766694897619318
- @MaxForAI: https://x.com/MaxForAI/status/2090620816644014339
- @Khazix0918: https://x.com/Khazix0918/status/2090623813335781821
Anthropic 同时补齐企业隐私、桌面操作和 AI 教育入口,产品从能力展示走向采用条件建设
Anthropic 的 Boris Cherny 表示,面向 Mythos 级模型的新数据安全方案预计秋季推出,企业可以自己持有和控制相关数据,Anthropic 不保留原始数据;该方案由包括 Salesforce 在内的 100 多家客户参与开发。与此同时,Computer Use 从 public beta 进入 Claude Platform 生产可用阶段,Claude Academy 也已免费向所有人开放,覆盖 AI 入门、Claude 使用、开发者和企业教程。三条信息共同指向同一个变化:Anthropic 不只展示模型能力,也在处理企业隐私合规、实际操作和用户教育这些落地阻力;但企业方案尚未正式上线,具体边界仍需等待后续公告。
来源:
- @bcherny: https://x.com/bcherny/status/2090537902912815536
- @MaxForAI: https://x.com/MaxForAI/status/2090569520717115493
- @MaxForAI: https://x.com/MaxForAI/status/2090569830286205306
- @xiaohu: https://x.com/xiaohu/status/2090648370306335229
GPT-Image-2 API 预览支持透明背景,图像生成开始更直接服务生产素材
OpenAI Developers 宣布 GPT-Image-2 API 预览支持透明背景,生成的产品图、UI 素材、游戏 Sprite 和网页组件可以直接叠加到不同背景上,减少后处理抠图。多位博主把它用于 Logo、桌宠和设计素材,说明这项更新的价值在工作流衔接而非单纯展示效果。另有 Datapoint AI 的开放评测:30 款模型在 500 个统一题目上生成图片,由真人完成超过 216 万次盲选,GPT Image 2(high)总榜第一,Seedream 5.0 Pro 和 Nano Banana 2 紧随其后,且前三差距很小。这个评测反映的是该数据集下的稳定性和偏好,不等于所有场景的全面排名。
来源:
- @OpenAIDevs: https://x.com/OpenAIDevs/status/2090536933571330440
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2090695814628978805
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2090641529861980618
- @Chengzilhy: https://x.com/Chengzilhy/status/2090823614610436353
Anthropic 上市预期升温,但招股书、募资规模和财务数字仍只能作为待核验消息
一位博主转述彭博消息称,Anthropic 可能最早在 8 月底公开提交 IPO 文件,此前已秘密向 SEC 提交材料,并准备超过 100 亿美元的 IPO 前循环信贷额度;报道还将潜在募资规模与 SpaceX 的 750 亿美元纪录比较。相关帖子进一步转述了收入快速增长和创始团队拟保留控制权等信息。由于当前可见证据主要是单一账号对媒体报道的二次整理,且招股书尚未出现在采集内容中,日报只记录为上市准备的高影响线索,不把“挑战最大 IPO”或具体估值、收入数字写成已确认事实。
来源:
小米 MiMo-V3-Pro 跑分图疑似提前流出,国产 Agent 模型竞争继续向旗舰区间靠拢但尚待官宣
社媒流传一张据称来自小米 MiMo-V3-Pro 的 Benchmark 截图,内容把它与 GLM 5.3、Kimi K3、Claude Opus 5、GPT-5.6 Sol Max 等模型并列比较。转述数据中,SWE-Bench Pro 为 72.8、Terminal-Bench 2.0 为 70.6、τ3-bench 为 76.4,部分项目接近图中海外旗舰模型。帖子也明确说明截图来源和最终成绩都需要官方确认,因此这些数字只能作为发布前线索,不能当作正式评测或产品能力结论。若正式版能复现,影响将主要体现在国产模型对 Coding Agent 和通用 Agent 高端市场的竞争位置。
来源:
旅行 Agent 的价值开始从“帮你规划”转向“替你完成操作”,但效果取决于行业系统是否接得上
围绕飞猪 App 新增的“飞猪帮帮”,博主指出其重点不是生成一份旅游攻略,而是把意图理解接到真实业务流程:用户可以用一句话请求改签,产品还覆盖值机选座、酒店升房、接送机、填写入境卡和开发票报销等操作,并支持多任务并行。这类产品解决的是 AI 把信息整理好后仍把执行成本留给用户的问题。不过航班改签、酒店升房和发票等环节分别依赖 GDS、酒店 PMS、航司接口和真实订单数据,能否完成取决于供给侧的接口与 SOP 是否为 Agent 准备好。可见证据是产品观察与分析,不等于所有场景均已稳定可用。
来源:
- @vista8: https://x.com/vista8/status/2090781365601794319
- @vista8: https://x.com/vista8/status/2090781359191290202
统计: 扫描时间线条数=600 命中的博主数=53 命中的推文总数=298 加权推文分=233.8 原创推文数=121 RT 推文数=60 抓取尝试次数=4 边界覆盖状态=tail_confidently_crossed_target_boundary