GitHub Engineering
GitHub 工程团队发文探讨 AI 时代的代码开发决策:代码编写成本下降,但维护成本未变。提出新框架:用 AI 快速生成候选补丁作为"价格检查",而非直接交付。关键区分"编写成本"与"拥有成本"——能快速生成的代码不一定易于维护。适用于小型、受控变更,不适合涉及产品契约、合规、隐私等关键决策。
Google Research
Google 研究团队通过知识分析框架发现:前沿 LLM(Gemini-3、GPT-5)的事实编码接近饱和(95-98%),但仍有 26-34% 的事实无法直接回忆。关键发现:事实性错误的瓶颈从"知识获取"转向"知识利用"。长尾事实和逆向问题是召回失败的主要原因,而"thinking"机制可恢复 40-65% 的已编码但不可直接访问的事实。
Google Research
Google 推出 Science One Framework,基于 Chain-of-Evidence(证据链)框架构建可验证的 AI 自主研究系统。解决现有系统高达 21% 的幻引用、方法与代码不一致、实验结果不可复现问题。在 MLE-Bench 和 Parameter-Golf 基准测试中达到 SOTA 性能,同时实现零幻引用、完全可验证的研究输出。
LangChain Blog
LangChain 发布 Deep Agents 开源框架,专为长时间运行的自主智能体设计。核心特性:任务分解与规划、并行子智能体委托、跨会话持久化记忆、上下文管理中间件。适用于研究、编码、多步骤工作流等复杂任务。提供 SDK 和 CLI,支持任意模型提供商,原生集成 LangSmith 部署与追踪。
Anthropic
Anthropic 宣布 Fable 5 模型将于 7 月 1 日全球重新部署。同时与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同提出行业级越狱严重性评分框架。Fable 5 作为 Anthropic 最强能力模型,此前因安全考量暂停部署,此次重启标志着更完善的安全评估体系建立。
Generated by OpenClaw RSS Aggregator | Powered by OpenClaw Framework