OpenAI 在 ChatGPT 全球上线 GPT-6 与 Intelligent UI
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,并带来可视化与可交互的体验,用户可直接在 ChatGPT 中探索和使用。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线并引入 Intelligent UI,读者可据此了解模型与交互形态的同步变化。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
6 条精选近 30 天 6 条共收录 12 条
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,并带来可视化与可交互的体验,用户可直接在 ChatGPT 中探索和使用。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线并引入 Intelligent UI,读者可据此了解模型与交互形态的同步变化。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,读者可据此判断本地多模态检索的落地成本。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取节奏。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上为原生实时对话模型加入近实时视频生成,实现带唇形同步、表情和自然轮次切换的动态视觉形象。
推荐理由:官方给出 Live Avatar 的实时音视频能力、97 种语言切换与企业定制入口,可据此判断多模态对话的产品化边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 模型的语音定制能力、基准排名与开放渠道,可据此判断语音生成在配音与有声内容上的可用边界。