跳到正文
AI 图鉴

Gemini

原生多模态、可处理超长上下文的通用模型

Google DeepMind 模型 闭源
输入文本图像音频视频文本

它是什么

Gemini 是 Google DeepMind 于 2023 年 12 月发布的多模态模型系列,从设计之初就同时处理文本、图像、音频与视频。它采用与 Google 既有产品线整合的方式,同时服务搜索、Workspace 与云平台。Gemini 1.5 版本把上下文窗口扩展到百万 token 级别,可以一次读入长文档、代码库或数小时的视频。它既是模型也是应用品牌,覆盖从轻量端侧到大型云端的多个规格。

为什么值得记住

把上下文窗口推到百万 token 量级并公开演示,直接改写了人们对“模型一次能读多少内容”的预期,也让多模态输入成为通用模型的标配。

关键规格

上下文窗口
1M tokens(Gemini 1.5 Pro)
模态
文本、图像、音频、视频输入;文本输出
发布
2023-12
开放权重
否

所属能力

相关概念

同类产品