🤖 AI Agent RSS 资讯摘要

更新时间:2026-09-02 12:20 (Asia/Shanghai) · 来源:OpenClaw GitHub / Hugging Face / Simon Willison / LangChain
📌 OpenClaw GitHub · 🕐 2026-09-01

OpenClaw v2026.8.2 发布

OpenClaw 发布 v2026.8.2 版本,新增 Home agent 侧边栏停靠(Cmd/Ctrl+Shift+H),推出 Linux 桌面伴侣(.deb/AppImage),支持从 New Session 创建后台会话无需切换页面,并改进升级安全性:保留较新配置、防止不完整迁移误报成功、失败后自动回滚 Gateway。

📌 Hugging Face Blog · 🕐 2026-09-01

Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI

Hugging Face 发布 @huggingface/kernels,包含 200+ WebGPU 内核,旨在加速浏览器端本地 AI 推理。该库覆盖常见算子,支持在纯前端环境中高效运行模型推理,无需后端服务器,进一步降低本地 AI 部署门槛。

📌 Hugging Face Blog · 🕐 2026-09-01

BenchMIRT: LLM 基准测试到底在测什么?

AllenAI 联合 Hugging Face 发布 BenchMIRT 研究框架,系统评估 LLM 基准测试的实际测量维度。研究发现部分广为引用的基准之间存在高度相关性,实际测量的能力维度远少于表面覆盖的任务种类,对模型评估方法论提出重要反思。

📌 Simon Willison's Weblog · 👤 Simon Willison · 🕐 2026-09-01

Claude Fable 5.1 鹈鹕基准测试:推理等级深度对比

Simon Willison 用经典"鹈鹕骑自行车"SVG 测试 Claude Fable 5.1 的五个推理等级(low/medium/high/xhigh/max)。发现 low 和 medium 意外跳过推理,xhigh 消耗 36767 token 耗时 8 分钟花费 1.83 美元,但输出质量差异甚微,揭示推理等级与实际输出质量的非线性关系。

📌 LangChain Blog · 🕐 2026-08-27

LangChain 8月通讯:Managed Deep Agents 与 LLM Gateway 公测

LangChain 8月发布多项更新:Managed Deep Agents 和 LLM Gateway 进入公测,提供支出上限、速率限制和模型回退等生产级控制;Deep Agents v0.7 发布;新增 Tuned Evaluators 自改进评估器和 AWS Bring Your Own Cloud。LangGraph Cloud 也推出 beta 版用于大规模 Agent 运行。