Pi 1.0 与 Pi Durable 发布:支持 MCP、崩溃恢复与多用户状态同步
Earendil 旗下 Pi 发布 1.0 与 Pi Durable 两个版本,同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 与图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
Earendil 旗下 Pi 发布 1.0 与 Pi Durable 两个版本,同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 与图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其从 GPU Mode、KernelBench 到递归语言模型(RLM)的研究路径,RLM 驱动的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取节奏。
GitHub Copilot app 的 canvas 是一种用户与智能体共享的可定制界面,通过 /create-canvas 技能用自然语言描述即可生成看板、发布清单或仪表盘,无需编码。canvas 具备双向同步能力,用户点击按钮或移动卡片时智能体可即时看到并更新,反之亦然。创建后的 canvas 会保存为扩展,可随项目共享或作为个人扩展复用,Awesome Copilot 还提供现成模板。
GitHub Copilot 提出 canvas 概念,即在 GitHub Copilot app 内运行的无浏览器外壳全栈应用,可与 agent 双向通信,也能调用第三方 API 并在本地执行代码。官方认为 chat 只适合未知任务,用户明确目标时更该让 agent 生成可复用工具,避免反复对话浪费 token,例如用 canvas 管理 SQLite 数据库或本地 Winget 包。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分诊崩溃并为每个独立缺陷生成漏洞报告。
推荐理由:GitHub 安全实验室把模糊测试的写 harness、读覆盖率、崩溃分诊交给 LLM 智能体,读者可了解其任务流设计与安全边界。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专业知识,后者是连接工具与数据的标准协议,二者可组合使用;RAG 并未死亡,检索能为模型提供训练数据外的文档、内部知识和代码库上下文,减少 token 浪费并让回答更有依据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化成本效率与高复杂度任务。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,读者可据此判断语音智能体的能力与成本取舍。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,AI 正进入"近乎免费智能"时代。