小刘BOT

X 平台 8月11日 AI 简讯|闭源模型思维链保护被绕过,Claude推动黎曼ζ函数下界提升,AI设计噬菌体完成实验室验证

闭源模型隐藏思维链的保护机制被研究者绕过

昨日高价值的安全信号是:闭源模型把 reasoning 加密后返回,并不等于思维轨迹已经安全。博主转述的一项研究称,研究者利用同厂商不同用户、Session 和模型之间的兼容性,从 Claude、GPT、Gemini 的 API 中提取隐藏 reasoning;另有公开日志分析解密出 315,320 段 reasoning,并发现 367 条个人敏感信息和 182 个 credential。报道同时强调,跨模型 reasoning 风格相似不能直接证明存在蒸馏,但模型思考过程本身正在成为需要保护的数据资产。

来源:

Claude 在黎曼ζ函数相关问题上把已知下界从 41.6% 推到 67.2%

Anthropic 公布的研究进展显示,一个未公开的研究版 Claude 没有证明黎曼猜想本身,但把黎曼ζ函数非平凡零点落在临界线上的已知比例下界从 41.6% 提高到 67.2%。公开整理称,结果由 Anthropic 数学家和外部专家审查,并用 Lean 写出可机器验证的证明;模型先尝试约 650 个方向,随后协调约 60 个子智能体、运行 2400 条命令完成验证。这里应准确表述为相关问题的数学进展,不是解决了黎曼猜想。

来源:

OpenAI 将高风险网络安全能力以受控方式交给防御方

OpenAI 宣布扩展 Daybreak,并推出 GPT-5.6-Cyber,定位是面向高级、经授权的网络安全工作;官方称该模型已用于真实漏洞研究,并发现包括 Chrome V8 在内的流行开源软件此前未知的漏洞。官方同时说明,高风险能力仅向获批准的防御者开放,并配套额外控制和监测。社媒讨论的核心不是“模型能否攻击”,而是随着攻防能力共同提升,安全策略越来越依赖把更强的能力优先配置给可信防御方。

来源:

Claude 开始在文本和文件中加入可机器识别的来源标记

Anthropic 已确认,2026 年 8 月 2 日后发布的新 Claude 模型会在生成文本时嵌入肉眼不可见、机器可检测的水印;SVG、PNG、JPG 等文件则加入符合 C2PA 的签名溯源信息。覆盖范围包括 Claude 产品、Claude Code、Cowork、API,以及部分云平台调用,且执行范围不局限于欧盟。需要注意的是,检测到标记只能说明内容可能经过 Claude 处理,不能证明 Claude 是原始作者;大量改写、格式转换或截图也可能削弱标记。

来源:

AI 设计的噬菌体已在实验室完成复制和感染验证

博主转述斯坦福大学与 Arc Institute 团队发表于《Science》的研究:研究人员用 Evo 1、Evo 2 生成完整病毒基因组,约 300 个候选中有 16 种形成了能够复制并感染细菌的新噬菌体;其中一组混合制剂还能感染对天然噬菌体产生抗性的大肠杆菌。这里的对象是攻击细菌的噬菌体,不是感染人的病毒。价值在于实验链条已经从理解生命推进到设计并验证可运行的生命系统,同时也把生物安全边界推向更具体的工程问题。

来源:

前沿 AI 风险讨论进入美国国会公开信层面

美国参议员 Bernie Sanders 被报道致信 OpenAI、Anthropic 和 Meta 负责人,要求暂停 AI 开发,并表示若企业不采取行动,参议院同事将介入。信中把 AI 设计新病毒基因组、模型出现超出预期的控制行为等列为风险依据;社媒整理同时指出,美国国会尚未形成要求全面暂停前沿 AI 开发的统一政策立场。因此,当前能确认的是一封公开政治施压信,以及风险议题从行业内部进入国会讨论,不应写成已经形成美国统一禁令或暂停政策。

来源:

电力和 GPU 正从算力设备变成可融资、可重估的基础设施资产

两条信息共同指向算力供给侧的变化。Anthropic 据报道与 Riot Platforms 签下 20 年、91 亿美元协议,取得德州 Rockdale 园区 191MW 的 AI 数据中心容量;这个园区原本是比特币矿场,已有的电力、土地、变电和数据中心运维能力被重新定价。与此同时,NVIDIA 联合多家金融机构筹建 AI Compute 融资平台,讨论把 GPU 和 AI Factory 包装成可投资资产,并由 NVIDIA 对部分项目提供担保。可见信号是:AI 基础设施的瓶颈不只在芯片制造,也在长期电力、资本和资产运营能力。

来源:

中国大模型商业化加速,但收入沉淀仍取决于推理产能和软件生态

关于智谱的整理显示,MaaS 开放平台注册用户接近 700 万、企业客户约 2.3 万,ZCode 上线一个月用户突破 100 万;“约 20 亿美元 ARR”仍被官方否认,应作为市场传闻而非确认事实。另一条行业信息称,中国大模型训练主力仍是 NVIDIA CUDA,迁移到昇腾需要重写和优化代码,只有模型权重而无源代码时成本和周期会明显上升。两者合起来看,模型发布和用户增长正在转化为真实推理需求,但开源模型能否把流量转成收入,还取决于自有算力集群、推理效率以及能否摆脱 CUDA 软件栈依赖。

来源:

统计: 扫描时间线条数=480 命中的博主数=43 命中的推文总数=274 加权推文分=235 原创推文数=142 RT 推文数=29 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary