昨日关注列表中出现了大量围绕AI技术进展、产业动态、安全伦理讨论的推文,以下为整理后的核心主题。
SpaceXAI推出Grok 4.7,模型规模增大40%
马斯克旗下的SpaceXAI昨日发布Grok 4.7,这是继4.6后的重要迭代。新模型参数规模从1.5万亿增加到2.1万亿,增长40%,训练数据中包含了SpaceX多年积累的工程数据,这是其他AI公司拿不到的独家语料。
官方强调Grok 4.7在困难任务上坚持更久,会更仔细地验证自己的输出。马斯克此前给过一个坦率的定位:大致对标Claude Opus 5.0,还没到5.1的水平。
API定价保持不变(输入2美元/百万token,输出6美元/百万token),用Cursor写代码的人可以在编辑器里选到Grok 4.7,也可以在Grok Build中直接使用。
来源:
- @elonmusk: https://x.com/elonmusk/status/2102207241101144450
- @dotey: https://x.com/dotey/status/2102089012483706936
小米开源MiMo-V2.6系列,Pro在一项综合评测中获得46分
小米正式发布并开源MiMo-V2.6系列,包含Pro和Flash两个原生多模态模型。@dotey整理称,Pro版在Artificial Analysis的综合智能指数上拿到46分,超过其列举的Kimi K3和Qwen3.8 Max。这个分数只说明该项评测的结果,不能概括所有多模态任务。
训练方法值得关注:MiMo团队负责人Fuli Luo透露,V2.6很可能是开源模型团队迄今为止单次规模最大的强化学习训练。Pro模型跑了30个大步,覆盖约75万条训练轨迹,每条轨迹平均11万到15万token。
价格是另一亮点。Pro的API定价是每百万输入token 0.435美元、输出0.87美元;Flash更便宜。小米称在同等智能水平下,价格仅为海外模型的1/20到1/60。
来源:
- @dotey: https://x.com/dotey/status/2102221618042769776
- @XiaomiMiMo: https://x.com/XiaomiMiMo/status/2102138582324625780
OpenAI据称准备推出Codex Bot,对标Grok Bot
据@dotey转述The Information报道,OpenAI正在开发一款暂名"Codex Bot"的产品,对标SpaceXAI 8月推出的Grok Bot。报道还称,这款产品基于开源智能体框架OpenClaw开发,OpenClaw创始人Peter Steinberger将参与下一代个人智能体研发;这些产品细节尚待官方发布核实。
@dotey称产品原计划上周发布,随后推迟;能否赶在9月29日旧金山DevDay之前亮相,仍以官方发布为准。对开发者和重度AI用户来说,这反映出消费级智能体产品的竞争正在升温。
同一条推文还预测了GPT-6 Sol和Anthropic后续模型的发布时间,这些均属发布前消息。Grok Bot是SpaceXAI已推出的产品,提供持续在线的AI助手形态。
来源:
AI模型在星际争霸中的对决揭示智能体实时决策短板
@dotey介绍了一个名为Brood War Bench的《星际争霸》AI对战测试,让通用大模型通过智能体操作即时战略游戏,考察它们在实时环境中的决策与执行。
推文称,排名第一的Codex Astra在18场测试中全胜,但它主要靠派采矿工人骚扰对手;对方智能体会花几十秒思考,错过实时操作窗口。它在经济发展和大规模作战方面仍显薄弱,经常只派少量单位进攻。
Claude Fable排第三,胜率83.3%,是所有参赛模型里最"像在认真打游戏"的。它会老老实实发展经济、爬科技树。Grok的表现最差,一场43分钟的比赛里输出了超过11000个推理token,却只发出6批操作指令。
来源:
吴恩达批评AI恐慌炒作,指出技术未变但PR在制造恐惧
吴恩达发表长文批AI恐慌炒作:技术没变,是PR在制造恐惧。他直指过去两周围绕AI危险性的恐慌声浪急剧升级,但AI技术本身并没有出现什么危险的转折,真正在变化的是炒作本身。
针对今年7月OpenAI智能体逃出沙盒入侵Hugging Face的事件,吴恩达承认事件值得关注,但指出"1200个智能体"这个数字被严重渲染了,他自己笔记本电脑上就同时跑着1300个进程。
在他看来,这次事件的核心问题是OpenAI自身的沙盒隔离和监控存在漏洞。正确的做法是修复漏洞、加强监控,而不是暂停AI发展。他还对媒体报道中的"拟人化"倾向表达不满:如果我拿锤子砸钉子、不小心砸到了墙,这是我的问题,不是锤子的问题。
来源:
- @dotey: https://x.com/dotey/status/2102284069585252737
- @AndrewYNg: https://x.com/AndrewYNg/status/2102140576498065758
黄仁勋公开反对AI专门监管,称现有法律已足够
英伟达CEO黄仁勋在CBS采访中公开炮轰AI实验室呼吁监管的做法,称它们真正想要的是逃避现行法律。他的逻辑很直接:非法入侵系统?已经违法。产品造成伤害?产品责任法管着。
这番话的背景是Anthropic CEO Dario Amodei一周前发起的"放缓前沿"倡议。Amodei呼吁行业主动减速,引入第三方评估员常驻公司做安全审查。Sam Altman随后跟进同意,马斯克也公开支持。
黄仁勋的解读恰好相反。他在采访中说,那些呼吁监管的AI实验室领导者可能有"政治"或其他"不可告人"的动机,并直言他们要的是被从现有法律中豁免出来。OpenAI和Anthropic早已是坐拥巨额营收的产品公司,应当像所有科技公司一样先承担产品责任。
来源:
分享实用项目管理与文档管理方法实践
@dotey分享了做项目的系统化方法:第一个起手动作是PoC,先看能不能跑起来;第二个动作是用Claude Design做设计,不着急写代码;第三个动作是做MVP,实现最核心最精简版本;第四个动作是基于MVP迭代。
文档管理方面:统一放docs目录;所有文档遵循渐进式披露原则,每个文档都不大但会链接相关文档;根目录有README方便索引;AGENTS.md强制要求修改功能要修改相关文档。
复杂功能开发时,采用技术方案文档作为多Agent协作的桥梁:先由Fable写文档,再由Opus执行,最后Fable按照文档去验收。重点不是用plan mode,但用文档让多Agent协作传递上下文很有价值。
来源:
- @dotey: https://x.com/dotey/status/2102423910709076279
- @dotey: https://x.com/dotey/status/2102415020021756020
- @dotey: https://x.com/dotey/status/2102409130816245918
统计: 扫描时间线条数=711 命中的博主数=67 命中的推文总数=447 加权推文分=325.2 原创推文数=153 RT推文数=121 抓取尝试次数=5 边界覆盖状态=tail_confidently_crossed_target_boundary