每日科技新闻速递

1. OpenAI 提出用“每美元完成多少有用工作”衡量 AI 价值

  • 标题:A scorecard for the AI age
  • 摘要:OpenAI 7 月 17 日提出“有用智能/美元”的评估框架,建议同时关注任务价值、成本、可靠性以及规模化后的效率。该框架是 OpenAI 提出的衡量方法,不是行业已经统一采用的标准。
  • 链接:OpenAI 官方文章

2. GitHub Copilot 用量指标扩展到仓库级别

  • 标题:Repository-level GitHub Copilot usage metrics generally available
  • 摘要:GitHub 宣布 Copilot usage metrics REST API 增加仓库级活动数据,可按日查看 Copilot coding agent 与 code review 的相关活动。它提供采用和协作指标,但不应直接被解释为独立验证的生产力因果结论。
  • 链接:GitHub 官方变更说明

3. GPT-Red 探索用模型自动化安全红队

  • 标题:GPT-Red: Unlocking Self-Improvement for Robustness
  • 摘要:OpenAI 发布 GPT-Red 研究,讨论训练自动化安全红队模型,用于发现提示注入等问题并帮助提升模型鲁棒性。页面将其定位为研究和实验性方法,不是已经普遍可用的安全产品。
  • 链接:OpenAI 官方研究

4. Copilot code review 增加配置与隔离能力

  • 标题:Copilot code review: Customization and configurability improvements
  • 摘要:GitHub 更新 Copilot code review,加入 firewall、custom setup steps 和独立 runner 配置,并支持从 head branch 读取自定义指令。企业使用时仍需自行验证权限、执行环境和生成评论的审查流程。
  • 链接:GitHub 官方变更说明

5. ChatGPT 的 Chat、Work 与 Codex 入口继续整合

  • 标题:ChatGPT release notes: Chat, Work, and Codex
  • 摘要:OpenAI 发布说明介绍 ChatGPT 对 Chat、Work 和 Codex 工作入口的组织方式,Codex 面向软件开发任务。入口整合不等于每个账号同时获得全部功能,具体可用范围仍受计划、地区和逐步推送影响。
  • 链接:OpenAI ChatGPT 发布说明

简短结论

AI 工具正在从“生成结果”转向可衡量、可配置、可测试的工程流程。OpenAI 给出价值评估框架并探索自动化红队,GitHub 则把 Copilot 活动度量与 code review 配置继续下沉到仓库和执行环境。