跳到正文
10月2日周五
10月1日周四
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取节奏。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvas 是一种用户与智能体共享的可定制界面,通过 /create-canvas 技能用自然语言描述即可生成看板、发布清单或仪表盘,无需编码。canvas 具备双向同步能力,用户点击按钮或移动卡片时智能体可即时看到并更新,反之亦然。创建后的 canvas 会保存为扩展,可随项目共享或作为个人扩展复用,Awesome Copilot 还提供现成模板。

9月25日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot 为什么说聊天框是错的 UI:用 canvas 替代 chat

    GitHub Copilot 提出 canvas 概念,即在 GitHub Copilot app 内运行的无浏览器外壳全栈应用,可与 agent 双向通信,也能调用第三方 API 并在本地执行代码。官方认为 chat 只适合未知任务,用户明确目标时更该让 agent 生成可复用工具,避免反复对话浪费 token,例如用 canvas 管理 SQLite 数据库或本地 Winget 包。

  2. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分诊崩溃并为每个独立缺陷生成漏洞报告。

    推荐理由:GitHub 安全实验室把模糊测试的写 harness、读覆盖率、崩溃分诊交给 LLM 智能体,读者可了解其任务流设计与安全边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专业知识,后者是连接工具与数据的标准协议,二者可组合使用;RAG 并未死亡,检索能为模型提供训练数据外的文档、内部知识和代码库上下文,减少 token 浪费并让回答更有依据。

9月16日周三
7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月7日周二