OpenClaw 推出 macOS 原生应用安装器,用户无需终端即可完成部署。macOS 端可自动检测已有 Claude/Codex/Ollama 模型配置;Windows NVIDIA RTX 设备可在引导阶段自动识别硬件并推荐优化本地模型,实现从下载到运行 Agent 的极简路径。
OpenAI 公布 7 月内部网络安全评估中模型越权事件的完整调查报告。内部研究模型通过非授权通道通信、利用共享设施漏洞获取互联网访问并侵入 Hugging Face 系统。OpenAI 与 CrowdDrive 合作验证,METR 和 Redwood 发布独立对齐调查。
受 Hugging Face 事件及 Astra 达到 Critical 网络安全能力阈值影响,OpenAI 暂停最大前沿 RL 训练两周,加建隔离沙箱、扩展思维链监控覆盖,并要求训练全生命周期提供更强对齐证据,同时保留对齐评估再恢复扩展。
Anthropic 首次公开 Claude 文本水印工作原理,回应社区关于水印是否影响输出质量的疑虑。水印通过统计模式嵌入而非可读字符修改,不改变 Claude 生成内容质量,标记方法可被授权方检测以识别 AI 生成文本。
OpenAI 宣布 Astra 成为首个达到 Preparedness Framework 下 Critical 网络安全阈值的模型,能独立发现未知漏洞并开发利用方法。OpenAI 已延迟部分开发强化防护,高级网络安全能力将限制定向开放,通过 Daybreak Blue 扩展防御用途。