Google Gemini API 提供从免费到企业级的全系列模型服务,可通过 Google AI Studio 快速上手,付费后解锁更高速率限制、上下文缓存和批处理 API(50% 折扣)。所有模型均支持文本、图像、视频、音频多模态输入。
Gemini 3 系列(最新)
-
Gemini 3.1 Pro(旗舰):
- 最强通用模型,具备先进的多模态理解、代理编码和 Vibe Coding 能力,适合最复杂的推理与创作任务。
- 支持 Google Search 和 Google Maps 工具接地(Grounding)。
- API 定价:输入 $2.00 / 1M tokens(≤200k),输出 $12.00 / 1M tokens。
-
Gemini 3 Flash(均衡):
- 以前沿级智能匹配更低成本,内置优越的搜索与接地能力,速度与效果兼顾。
- API 定价:输入 $0.50 / 1M tokens,输出 $3.00 / 1M tokens。免费层可用。
-
Gemini 3.1 Flash-Lite(轻量):
- 成本最低的 Gemini 3 模型,针对高并发智能体任务、翻译和简单数据处理优化。
- API 定价:输入 $0.25 / 1M tokens,输出 $1.50 / 1M tokens。免费层可用。
-
Gemini 3.1 Flash Live(实时语音):
- 高质量低延迟的音频到音频(A2A)实时对话模型,支持声学细节感知与多模态感知,适合语音优先的 AI 应用。
-
Gemini 3.1 Flash TTS(语音合成):
- 低延迟可控语音生成,支持自然输出、可引导提示和精准叙述控制的表达式音频标签。
Gemini 2.5 系列(稳定)
-
Gemini 2.5 Pro:多用途旗舰,擅长编码与复杂推理,支持 1M 上下文。输入 $1.25 / 1M tokens,输出 $10.00 / 1M tokens。
-
Gemini 2.5 Flash:首款混合推理模型,支持 1M 上下文和思考预算(Thinking Budgets),性价比最优。输入 $0.30 / 1M tokens,输出 $2.50 / 1M tokens。免费层可用。
-
Gemini 2.5 Flash-Lite:最小最经济的 2.5 系列模型,适合大规模部署。输入 $0.10 / 1M tokens,输出 $0.40 / 1M tokens。免费层可用。
生成媒体模型
-
Imagen 4:最新文生图模型,文字渲染与图像质量大幅提升,支持最高 2K 分辨率。Fast $0.02 / 张,Standard $0.04 / 张,Ultra $0.06 / 张。
-
Veo 3.1:最新视频生成模型,支持原生同步音频,具备先进的电影级创意控制。标准版 $0.40 / 视频(720p/1080p),4K $0.60 / 视频。
-
Lyria 3:Google 旗舰音乐生成模型,支持完整歌曲(Pro,$0.08 / 首)和短片段循环(Clip,$0.04 / 首)。
专项工具模型
-
Gemini Embedding 2:首款多模态嵌入模型,将文本、图像、视频、音频、PDF 统一映射到同一嵌入空间,适合跨模态语义搜索和 RAG 系统。
-
Gemini Deep Research:自主规划并执行跨数百个来源的多步骤研究,生成带引用的交互式报告,支持协作规划和 MCP。
-
Computer Use:可”看见”数字屏幕并执行点击、输入、导航等 UI 操作,自动化复杂浏览器任务。
适用场景
- 复杂推理与代理编码:使用 Gemini 3.1 Pro 处理高难度多步骤推理、代码生成与 Vibe Coding 工作流。
- 长文档理解:1M 超长上下文支持整本书、完整代码库或大型合同的一次性分析,推荐 Gemini 2.5 Pro 或 3.1 Pro。
- 实时语音对话:使用 Gemini 3.1 Flash Live 构建低延迟语音优先的 AI 应用,支持双向音视频流。
- 多模态内容生成:图片(Imagen 4)、视频(Veo 3.1)、音乐(Lyria 3)一站式生成,适合多媒体创作平台。
- 搜索增强应用:内置 Google Search 和 Google Maps 接地能力,适合需要实时信息检索的问答和导航类应用。
- 自主研究智能体:使用 Gemini Deep Research 自动完成跨源信息收集与综合报告生成。
- 低成本高频调用:使用 Gemini 3.1 Flash-Lite 或 2.5 Flash-Lite 处理翻译、分类、摘要等高并发轻量任务,免费层即可起步。