智站集市 logo 智站集市

官方 API

Google AI

Google 官方 AI API 平台,通过 Gemini API 统一提供 Gemini 3.1 Pro / Flash 旗舰对话模型、Imagen 4 图片生成、Veo 3.1 视频生成、Lyria 3 音乐生成等全系列模型,支持 1M 超长上下文、实时语音对话,并深度集成 Google Search 与 Maps 工具,是能力最全面的多模态 AI 接口平台之一。

试用 全球 ⭐ 4.7 更新 2026/05/12
文本生成 多模态 长上下文 图片生成 视频生成 音乐生成 实时语音 智能体 免费额度

Google Gemini API 提供从免费到企业级的全系列模型服务,可通过 Google AI Studio 快速上手,付费后解锁更高速率限制、上下文缓存和批处理 API(50% 折扣)。所有模型均支持文本、图像、视频、音频多模态输入。

Gemini 3 系列(最新)

  • Gemini 3.1 Pro(旗舰):

    • 最强通用模型,具备先进的多模态理解、代理编码和 Vibe Coding 能力,适合最复杂的推理与创作任务。
    • 支持 Google Search 和 Google Maps 工具接地(Grounding)。
    • API 定价:输入 $2.00 / 1M tokens(≤200k),输出 $12.00 / 1M tokens。
  • Gemini 3 Flash(均衡):

    • 以前沿级智能匹配更低成本,内置优越的搜索与接地能力,速度与效果兼顾。
    • API 定价:输入 $0.50 / 1M tokens,输出 $3.00 / 1M tokens。免费层可用。
  • Gemini 3.1 Flash-Lite(轻量):

    • 成本最低的 Gemini 3 模型,针对高并发智能体任务、翻译和简单数据处理优化。
    • API 定价:输入 $0.25 / 1M tokens,输出 $1.50 / 1M tokens。免费层可用。
  • Gemini 3.1 Flash Live(实时语音):

    • 高质量低延迟的音频到音频(A2A)实时对话模型,支持声学细节感知与多模态感知,适合语音优先的 AI 应用。
  • Gemini 3.1 Flash TTS(语音合成):

    • 低延迟可控语音生成,支持自然输出、可引导提示和精准叙述控制的表达式音频标签。

Gemini 2.5 系列(稳定)

  • Gemini 2.5 Pro:多用途旗舰,擅长编码与复杂推理,支持 1M 上下文。输入 $1.25 / 1M tokens,输出 $10.00 / 1M tokens。

  • Gemini 2.5 Flash:首款混合推理模型,支持 1M 上下文和思考预算(Thinking Budgets),性价比最优。输入 $0.30 / 1M tokens,输出 $2.50 / 1M tokens。免费层可用。

  • Gemini 2.5 Flash-Lite:最小最经济的 2.5 系列模型,适合大规模部署。输入 $0.10 / 1M tokens,输出 $0.40 / 1M tokens。免费层可用。

生成媒体模型

  • Imagen 4:最新文生图模型,文字渲染与图像质量大幅提升,支持最高 2K 分辨率。Fast $0.02 / 张,Standard $0.04 / 张,Ultra $0.06 / 张。

  • Veo 3.1:最新视频生成模型,支持原生同步音频,具备先进的电影级创意控制。标准版 $0.40 / 视频(720p/1080p),4K $0.60 / 视频。

  • Lyria 3:Google 旗舰音乐生成模型,支持完整歌曲(Pro,$0.08 / 首)和短片段循环(Clip,$0.04 / 首)。

专项工具模型

  • Gemini Embedding 2:首款多模态嵌入模型,将文本、图像、视频、音频、PDF 统一映射到同一嵌入空间,适合跨模态语义搜索和 RAG 系统。

  • Gemini Deep Research:自主规划并执行跨数百个来源的多步骤研究,生成带引用的交互式报告,支持协作规划和 MCP。

  • Computer Use:可”看见”数字屏幕并执行点击、输入、导航等 UI 操作,自动化复杂浏览器任务。

适用场景

  • 复杂推理与代理编码:使用 Gemini 3.1 Pro 处理高难度多步骤推理、代码生成与 Vibe Coding 工作流。
  • 长文档理解:1M 超长上下文支持整本书、完整代码库或大型合同的一次性分析,推荐 Gemini 2.5 Pro 或 3.1 Pro。
  • 实时语音对话:使用 Gemini 3.1 Flash Live 构建低延迟语音优先的 AI 应用,支持双向音视频流。
  • 多模态内容生成:图片(Imagen 4)、视频(Veo 3.1)、音乐(Lyria 3)一站式生成,适合多媒体创作平台。
  • 搜索增强应用:内置 Google Search 和 Google Maps 接地能力,适合需要实时信息检索的问答和导航类应用。
  • 自主研究智能体:使用 Gemini Deep Research 自动完成跨源信息收集与综合报告生成。
  • 低成本高频调用:使用 Gemini 3.1 Flash-Lite 或 2.5 Flash-Lite 处理翻译、分类、摘要等高并发轻量任务,免费层即可起步。