OpenAI Astra 的公开线索指向“AI 主导数学研究”,但仍应视为待核验进展
昨日可见信息显示,OpenAI 内部代号 Astra 的未发布模型被用于推进 10 个数学与理论计算机科学难题,范围涉及球体堆积、群论、量子复杂度、格密码学和极值组合数学等;相关帖子称每项结果都配有 Lean 4 形式化证明与代码。它值得关注的原因,不只是模型回答了难题,而是工作形态被描述为“模型提出论证、人类整理并形式化验证”,长期任务和可验证研究流程可能成为下一阶段能力展示的重点。现有材料主要来自 OpenAI 研究人员转发及博主整理,Astra 尚未在这些记录中作为正式公开产品发布,具体定理和证明仍应以原文及代码核验。
来源:
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2083494076494873046
- @SebastienBubeck: https://x.com/SebastienBubeck/status/2083456300692979886
- @sama: https://x.com/sama/status/2083552732225417342
DeepSeek V4 Flash 0731 把“强模型”进一步推向开源、低价和本地运行
DeepSeek V4 Flash 0731 的可见发布信息包括开放权重、公开测试 API,以及面向 Agent 的能力升级;相关博主还给出了本地运行的量化门槛:3-bit 约需 110GB 总内存,4-bit 约需 168GB,192GB 统一内存设备可以尝试完整运行。另有记录称它已被接入 Codex 和 Hermes Agent,并在开源模型榜单中进入前三。这里的关键变化是能力、部署方式和调用入口同时下沉:开发者不必只通过封闭 API 使用高能力模型,但具体性能与榜单结论仍应区分官方发布、第三方测试和个人实测。
来源:
- @deepseek_ai: https://x.com/deepseek_ai/status/2083084415157022911
- @xiaohu: https://x.com/xiaohu/status/2083383860788936977
- @MaxForAI: https://x.com/MaxForAI/status/2083455655671988312
YC 开源 QM,Agent 的竞争对象开始从个人助手转向组织工作基础设施
YC 宣布开源内部使用的 multi-agent harness QM,定位是让整家公司共同使用 Agent,而不只是让几个 Agent 协同聊天。记录中明确提到:员工、频道和项目可拥有独立的记忆、文件、权限、密钥视图、定时任务与持久沙箱,并支持 Slack、Web、连接器、浏览器和可分享的内部应用;YC 称会计、法务、活动、工程等团队已在使用。这个案例的价值在于,它把 Agent 的核心问题从“会不会完成一次任务”推进到组织边界、长期状态、权限和多人协作。
来源:
- @ycombinator: https://x.com/ycombinator/status/2083243960684908768
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2083410602811421165
- @MaxForAI: https://x.com/MaxForAI/status/2083315784684814584
Codex 插件把 SaaS 上线链路里的“人工胶水”压缩成一次对话
一条实践记录展示了 Stripe、Supabase、Vercel、Cloudflare 四个出海常用服务被装入 Codex 后的工作流:Agent 可读取计费代码,创建商品和价格,更新数据库与权限,补 Webhook 和环境变量,部署并读取日志,再根据结果继续修复。另一位创作者则记录了用 Codex Computer Use 配合飞书文档和自定义 Skill,把直播视频转成剪辑成片并下载;Skill 是在多轮优化后固化出来的。它们共同说明,插件和 Skill 的价值不只是增加工具入口,而是让跨服务返回值连续传递、把重复流程变成可复用 SOP;这些是个人实测,不等于所有项目都能无人工验收上线。
来源:
- @MANISH1027512: https://x.com/MANISH1027512/status/2083554200043335892
- @PMbackttfuture: https://x.com/PMbackttfuture/status/2083468003379761342
Seedance 2.5 的提升集中在真实感和物理效果,但创作者仍会按成本选择 2.0
多条实测把 Seedance 2.5 与 2.0 放在同一素材、同一提示词下比较:2.5 的环境真实感、动作与空间反馈、特效和镜头跟随更强,适合高燃特效、游戏概念片和更电影化的表达;但也有创作者认为 2.0 的人物美学更舒服,日常短视频不一定值得升级。价格是明确的使用门槛:记录中出现月卡 998 元、季度 1958 元,以及 30 秒视频消耗大量积分;另有测试称上传短参考视频可以降低部分积分消耗。综合来看,2.5 的优势已能被普通创作者感知,但是否购买取决于真实感需求和单位成片成本。
来源:
- @Chengzilhy: https://x.com/Chengzilhy/status/2083397129494565154
- @joshesye: https://x.com/joshesye/status/2083407176983351627
- @LufzzLiz: https://x.com/LufzzLiz/status/2083538004250177708
- @AlchainHust: https://x.com/AlchainHust/status/2083351999375085654
Grok Imagine 1.5 扩展到文字生视频、图像与声音参考,并把 1080p 放进更高订阅档
Grok 官方账号的可见更新包括文字生成视频、图像和声音参考,以及原生 1080p;转述信息还称 1080p 需要 SuperGrok Plus 以上套餐,月费为 100 美元。这个变化把视频生成从单一提示词继续推向多模态参考和更高输出规格,创作者可以用既有图像、声音和文字共同控制结果。不过当前记录主要是官方帖子被博主引用和补充价格,未提供完整地区、套餐和开放范围,使用前仍需以产品页面为准。
来源:
- @grok: https://x.com/grok/status/2083353607370416632
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2083572265875353892
- @elonmusk: https://x.com/elonmusk/status/2083356782693380350
Google Earth 的 Nano Banana 试验暴露出真实地点生成的内容安全边界
Google Earth 的可见产品帖介绍了把 Nano Banana 图像生成接入地图,让用户基于卫星、航拍和 3D 影像重新构想现实地点。一条后续转述称,用户曾定位美国某栋建筑并生成类似灾难事件的效果图,随后发帖者再查看时已看不到该功能。可以确认的是产品能力与社媒中出现的滥用线索;“因此下线”是普通账号的推断,原始记录没有给出 Google 的正式解释。对真实世界地图加生成能力而言,地点语境、灾难暗示和误导性图像会成为上线范围与审核策略的关键约束。
来源:
- @googleearth: https://x.com/googleearth/status/2082818165503902043
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2083509084729532758
统计: 扫描时间线条数=360 命中的博主数=32 命中的推文总数=224 加权推文分=176.45 原创推文数=91 RT 推文数=44 抓取尝试次数=2 边界覆盖状态=tail_confidently_crossed_target_boundary