输入文本图像音频视频文本
它是什么
Gemini 是 Google DeepMind 于 2023 年 12 月发布的多模态模型系列,从设计之初就同时处理文本、图像、音频与视频。它采用与 Google 既有产品线整合的方式,同时服务搜索、Workspace 与云平台。Gemini 1.5 版本把上下文窗口扩展到百万 token 级别,可以一次读入长文档、代码库或数小时的视频。它既是模型也是应用品牌,覆盖从轻量端侧到大型云端的多个规格。
为什么值得记住
把上下文窗口推到百万 token 量级并公开演示,直接改写了人们对“模型一次能读多少内容”的预期,也让多模态输入成为通用模型的标配。
关键规格
- 上下文窗口
- 1M tokens(Gemini 1.5 Pro)
- 模态
- 文本、图像、音频、视频输入;文本输出
- 发布
- 2023-12
- 开放权重
- 否