每日科技新闻速递
今日口径:8 月 16 日没有检索到足够多、可独立确认的同日科技发布,因此本文采用“近期节点回顾”口径,整理 7 月 29 日至 8 月 12 日的 AI 开发工具、成本治理与 agent 评估更新。每条均保留原始发布日期、适用范围和产品状态,不把厂商实验或平台公告扩大为普遍效果。
1. Agent Plugins 1.0 在多款 Copilot 客户端正式可用
- 标题:Agent Plugins 1.0 in VS Code, Copilot CLI, and the Copilot app
- 摘要:GitHub 8 月 12 日宣布,Agent Plugins 1.0 已在 VS Code、Copilot CLI、GitHub Copilot SDK 和 Copilot app 中正式可用。该开放标准把 agent skill 与 MCP server 配置打包为一个可安装插件,并用命名空间保留客户端特有能力;“一次构建、跨客户端使用”仍取决于各客户端实际支持的 skill、MCP 与扩展能力,不能理解为所有行为完全一致。
- 链接:GitHub Changelog 原始公告 / Agent Plugins 规范
2. GitHub 用分模型 token 明细解释 Copilot AI credits
- 标题:Per-model token breakdown in the usage report
- 摘要:GitHub 8 月 11 日为 AI usage report 增加分模型 token 明细,管理员和个人用户可以查看输入、输出、缓存读取、缓存写入 token 与 AI credits 的对应关系。该能力让费用追踪从单一 credits 数字下钻到模型与 token 类型,但它是账单可观测性更新,不代表平台会自动替团队优化模型选择或成本。
- 链接:GitHub Changelog 原始公告 / GitHub 账单报告文档
3. Google 将 agent 与模型评估能力推进到 GA
- 标题:Agent and Model Evaluations in Gemini Enterprise Agent Platform are now GA
- 摘要:Google 7 月 31 日宣布 Gemini Enterprise Agent Platform 的 agent 与模型评估正式可用,提供 20 多项预置指标,覆盖质量、安全、grounding、工具使用和轨迹,并支持实验、在线监测与生产漂移告警。Google 说明服务端实验产物可保存在客户项目的 Cloud Storage 中;LLM-as-a-judge 等模型型指标仍会产生模型调用费用,因此“GA”不等于评估无需成本或人工复核。
- 链接:Google Developers Blog 原始公告 / Agent evaluation 文档
4. GitHub 调整企业 Copilot 新模型的默认启用策略
- 标题:Default model enablement for Copilot Business and Enterprise
- 摘要:GitHub 7 月 29 日公布 Copilot Business 与 Enterprise 的全局默认模型策略:一般可用的新模型将继承组织或企业的默认设置,策略于 8 月 26 日生效,管理员仍可显式启用或禁用单个模型。开放权重模型以及未纳入 GitHub 数据保留协议的模型被排除在默认启用之外,因此该变化不是“所有模型自动开放”。
- 链接:GitHub Changelog 原始公告
5. OpenAI 实验显示评测结果高度依赖 agent harness
- 标题:How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
- 摘要:OpenAI 7 月 29 日披露,在 ARC-AGI-3 公开任务集上,通过 Responses API 保留推理并启用 compaction 后,GPT-5.6 Sol 的 RHAE 分数由 13.3% 提升至 38.3%,输出 token 减少约 6 倍。数据来自 OpenAI 针对自身模型与 harness 的实验,说明评测也会测到上下文管理和运行框架;它不能直接推出所有模型、任务或第三方实现都会获得同等提升。
- 链接:OpenAI 原始研究 / ARC-AGI-3
简短结论
这组更新把 AI 开发工具的竞争从“接入更多模型”推进到了四个更具体的工程层面:插件能否跨客户端复用、成本能否解释到模型与 token、agent 能否在开发和生产使用一致的评估方法,以及模型策略能否由组织统一治理。OpenAI 的 ARC-AGI-3 实验还提醒开发者,模型能力与 harness 设计无法完全分开判断;真正可复现的效果必须同时记录模型、API 设置、上下文策略和评测环境。
本文基于 GitHub、Google 与 OpenAI 的官方公开资料整理。Chrome 已恢复连接,但本轮没有向 ChatGPT 提交候选进行辅助逐条评估;正文因此完全依据原始页面独立核验,并收紧了开放标准、费用、GA 状态、默认启用范围和厂商实验边界,最终判断以原始链接为准。
