GLM-5.3把开源模型竞争推进到 Coding 与网络安全
可见信息显示,智谱发布 GLM-5.3,与 GLM-5.2 共用同一基座,主要通过后训练强化编程、长程任务、工具调用和网络安全能力。博主转述的公开评测中,Terminal Bench 3.0 从 4.6 提升到 28.3,DeepSWE 从 46.2 提升到 66.9;CyberGym 达到 84.5。另有公开转述称,模型已在 269 个开源项目中发现 2436 个漏洞,其中 1097 个为严重或高危漏洞。上述数字主要来自博主对智谱发布材料的转述或解读,实测结论仍应与原始评测区分。
来源:
- @dotey: https://x.com/dotey/status/2088141236511064464
- @xiaohu: https://x.com/xiaohu/status/2088259618380403066
- @MaxForAI: https://x.com/MaxForAI/status/2088142739150090665
DeepSeek Harness显示插件优先的 Agent 产品路线
多位博主的源码分析、上手和实测显示,DeepSeek Harness 更像面向开发者的底层 Agent 框架:插件可加载、替换并管理依赖,任务过程可观测,产品以 Web UI 和插件机制为主要入口,但命令行安装、配置和早期体验对普通用户并不友好。社区已出现聚合 143 个插件、标注权限和风险的检索站,也有实测用它零修改生成可交互的 3D 魔方教程,说明其价值目前更集中在可扩展性和二次改造,而非开箱即用。
来源:
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2087933477073375507
- @LufzzLiz: https://x.com/LufzzLiz/status/2088156818505863183
- @zstmfhy: https://x.com/zstmfhy/status/2088109548708262002
Qwen3.8-27B把前沿 Agent 能力下沉到更易部署的规模
博主转述 Alibaba Qwen 的公开信息称,Qwen3.8-27B 已开放权重,采用 Dense 架构,原生支持图像和视频理解,上下文为 262K tokens、可扩展至 1M,并使用 Apache 2.0 许可。转述的官方评测显示,它在若干 Coding、办公和 Computer Use 指标上超过更大的 Qwen3.7-Plus及部分闭源模型,但在 Terminal Bench、GPQA Diamond 等项目仍有差距。真正值得关注的不是“全面超过”,而是较强的 Agent 能力开始进入本地工作站、私有化部署和大规模产品更可承受的参数区间。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2088293310691770476
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2088284495678198190
GPT-5.6 Sol Ultrafast把低延迟推理推到产品入口
OpenAI 正式预览 GPT-5.6 Sol 的 Ultrafast 模式,官方称速度最高可达标准模式的 14 倍、每秒约 750 tokens,首批通过 API 向少量客户开放,并由 Cerebras 提供算力。官方列出的目标场景包括实时语音、客服、电商、Coding、设计、金融研究和安全响应;这说明速度已经从单纯体验指标,变成实时 Agent 能否成立的产品约束。目前它仍是随算力容量逐步扩大的 Limited Preview,不代表已普遍可用。
来源:
- @OpenAI: https://x.com/OpenAI/status/2087947721936359705
- @sama: https://x.com/sama/status/2088101491802243121
Computer History让 ChatGPT 和 Codex接入近期工作上下文
OpenAI 在 Mac 桌面端推出可选的 Computer History,向 Pro、Business 和 Enterprise 用户逐步开放。官方描述的功能是记录用户跨应用和网站的近期活动,生成可回看的时间线,让 ChatGPT 和 Codex 接续上下文、识别重复工作并建议生成 Skill 或自动化;用户可以清除全部或部分历史、排除应用和网站,也可以暂停或恢复记录。它的实际价值在于减少“重新解释背景”的成本,但由于涉及工作轨迹,是否启用和如何设置范围仍是关键使用前提。
来源:
- @OpenAI: https://x.com/OpenAI/status/2087996497908609389
- @OpenAIDevs: https://x.com/OpenAIDevs/status/2088000960891408677
- @xiaohu: https://x.com/xiaohu/status/2088106472634974249
X开放 For You 推荐算法后,互动权重与负反馈变得可分析
X 公开了 For You 时间线相关代码,并推出小范围测试的可见性限制查询工具。博主基于源码的解读称,复制链接、回复和转发的权重高于点赞,互关好友回复有额外权重;举报、静音等负反馈的扣分显著,视频观看还存在时长门槛。另一份整理据此建议创作者优先做值得转发的原创内容、减少刷屏和互动诱饵。这里的权重与运营建议属于博主对公开代码的分析,不能直接等同于平台对所有账号的最终分发结果。
来源:
- @xiaohu: https://x.com/xiaohu/status/2088092704907636773
- @zstmfhy: https://x.com/zstmfhy/status/2088168871853457420
- @op7418: https://x.com/op7418/status/2088172365750645091
Cursor并入 SpaceXAI,Coding Agent与模型和算力进一步合流
公开帖子中可见 Cursor 已宣布加入 SpaceXAI,相关公告描述其团队将从软件工程切入,继续参与 Grok、Grok Build、Grok Bot、Grok API 和 Cursor 等产品。马斯克的转述回应确认团队加入 SpaceX;这条信息的价值在于,成熟的 Coding Agent、模型研发、GPU 算力和开发者分发入口开始被放到同一组织协同,可能改变 Coding Agent 的产品竞争方式。当前摘要只按可见公告写事实,不对转述中的交易金额或未被官方帖子直接确认的细节作扩展。
来源:
- @elonmusk: https://x.com/elonmusk/status/2088273489820061920
- @MaxForAI: https://x.com/MaxForAI/status/2088290407809728905
MiniMax Music 3.0把完整歌曲生成带到单卡本地运行
博主介绍 MiniMax Music 3.0 已开源,可根据歌词和风格描述一次生成约五分钟的完整歌曲,包含前奏、主歌和桥段,输出为 32kHz 立体声;其介绍还称单卡 8GB 显存即可运行,并配套开放 1000 个模板和扩写 Skill。若这些公开参数与实际仓库一致,它的意义不只是音频生成质量,而是把长时长音乐创作的本地试用和二次开发门槛压到更低;目前 report 中主要是单一博主的直接介绍,仍应以项目原始发布为准。
来源:
统计: 扫描时间线条数=480 命中的博主数=45 命中的推文总数=283 加权推文分=229.6 原创推文数=128 RT 推文数=49 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary