Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、分层计费与第三方评测数据,并指出高 token 消耗可能抵消单价优势。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、分层计费与第三方评测数据,并指出高 token 消耗可能抵消单价优势。
Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价与 OpenAI 上月发布的 GPT-6 Luna 一致,为每百万 token 输入 0.10 美元、输出 0.50 美元,超过 100,000 token 后涨至 0.50/2.50 美元。
Common Sense Media 青年 AI 安全研究所用 4000 多条测试提示评估后,将面向青少年的 ChatGPT 评为对未成年人不可接受风险,并呼吁在独立测试确认安全前让青少年远离该服务。
推荐理由:独立机构用4000多条测试提示评估ChatGPT青少年防护,家长警报在自杀对话中未触发,为监管与诉讼提供了具体证据。
Microsoft 研究合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中与首席应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
推荐理由:Reflection 从隐身状态交出首个开源权重模型,读者可对照其训练规模与第三方评测,判断美国开源阵营的位置。
GitHub 发布 AI 代码审查开放基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 Astra 的 $10/$50 大幅降低,在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分。