LangChain 发布企业级 Agent 扩展指南,展示施耐德电气、沃达丰和 monday.com 在欧洲与中东的生产级 AI 实践。涵盖共享 Agent 平台建设、LLMOps 流程、多 Agent 架构设计,以及更强的可观测性、评估与控制能力。
LangChain 与 Nevermined 合作推出 Agent 支付能力,让 LangChain Agent 能够自主购买和销售服务。这标志着 Agent 经济基础设施的重要进展,Agent 可通过支付协议完成资源交易与服务协作。
llm-gemini 0.34 发布,新增 Gemini 3.8 Flash 模型支持(含低/中/高三思考级别),修复异步响应未记录模型版本的问题。Simon 测试后称赞其快速、廉价且擅长 HTML/JS 生成,13 秒花费 1.8 美分生成完整 HTML 演示。
Anthropic 更新 Claude 消费版系统提示词,重组为按模型分页展示。新提示词严格禁止复现歌词和版权角色内容,平台文档支持 .md 后缀获取 Markdown 版本,便于 LLM 直接消费。
OpenClaw 发布 v2026.8.2 版本,新增 Home agent 侧边栏停靠(Cmd/Ctrl+Shift+H),推出 Linux 桌面伴侣(.deb/AppImage),支持从 New Session 创建后台会话无需切换页面,并改进升级安全性:保留较新配置、防止不完整迁移误报成功、失败后自动回滚 Gateway。
Hugging Face 发布 @huggingface/kernels,包含 200+ WebGPU 内核,加速浏览器端本地 AI 推理。覆盖常见算子,支持纯前端环境高效运行模型推理,无需后端服务器,进一步降低本地 AI 部署门槛。
AllenAI 联合 Hugging Face 发布 BenchMIRT 研究框架,系统评估 LLM 基准测试的实际测量维度。研究发现部分广为引用的基准之间存在高度相关性,实际测量的能力维度远少于表面覆盖的任务种类,对模型评估方法论提出重要反思。
Simon Willison 用经典"鹈鹕骑自行车"SVG 测试 Claude Fable 5.1 的五个推理等级。发现 low 和 medium 意外跳过推理,xhigh 消耗 36767 token 耗时 8 分钟花费 1.83 美元,但输出质量差异甚微,揭示推理等级与实际输出质量的非线性关系。
LangChain 8月发布多项更新:Managed Deep Agents 和 LLM Gateway 进入公测,提供支出上限、速率限制和模型回退等生产级控制;Deep Agents v0.7 发布;新增 Tuned Evaluators 自改进评估器和 AWS Bring Your Own Cloud。LangGraph Cloud 推出 beta 版用于大规模 Agent 运行。