Newsroom
AIEII

Gemini 3.7 Flash API 怎么调用:价格和限流实测

Gemini 3.7 Flash 已于 2026 年 8 月 13 日上线,输入输出限时降到每百万 token 0.75/3.75 美元,2027 年起涨回原价;1M 上下文、6.4 万输出上限、免费层限额怎么算,附调用代码。

TL;DR
  • Gemini 3.7 Flash 已于 2026 年 8 月 13 日上线,输入 0.75 美元、输出 3.75 美元每百万 token 是限时价,2027 年 1 月 1 日起涨回 1.50/7.50 美元。
  • 上下文窗口 1,048,576 token(约 1M),单次最多能吐 65,536 token,够塞下一整个中型代码仓库。
  • 免费层价格是 0 美元,但请求频率卡得很紧,适合测试不适合跑生产流量;生产环境基本绕不开付费层。
Gemini 3.7 Flash API 怎么调用:价格和限流实测

8 月 13 日,Google 把 Gemini 3.7 Flash 放出来了,离上一代 3.6 Flash 发布才过去三周。最扎眼的不是模型本身,是价格:输入每百万 token 0.75 美元,输出 3.75 美元,比标准价直接砍掉一半。这个折扣不是长期福利,写在官方定价页上的原话是"通过 2026 年 12 月 31 日",过了这个日子自动涨回 1.50 美元和 7.50 美元。

这篇把价格、上下文限制、免费层实际能用到什么程度,还有一段能直接跑的调用代码都放齐,省得你自己翻文档拼凑。


价格表:限时价和 2027 年后的正常价

Google 官方定价页把这次的优惠期限写得很清楚,截至我 8 月 16 日核对时是这样:

项目2026-12-31 前(限时价)2027-01-01 起(标准价)
输入(每百万 token)0.75 美元1.50 美元
输出含思考 token(每百万 token)3.75 美元7.50 美元
Batch API 输入0.375 美元0.75 美元
Batch API 输出1.875 美元3.75 美元
上下文缓存读取0.075 美元0.15 美元
上下文缓存存储(每百万 token/小时)0.50 美元1.00 美元
免费层输入/输出0 美元0 美元(长期不变)

限时价覆盖 Google AI Studio 和 Gemini Enterprise Agent Platform 两条路径,不是 AI Studio 专属福利。输出价格里明确包含思考 token,也就是说开了 thinking 模式后模型内部推理消耗的 token 也按输出价计费,这个坑很多人第一次算账时会漏掉。

Batch API 走的是异步批处理,价格是标准价的一半,适合不要求实时返回的场景,比如批量打标签、批量摘要。上下文缓存这块,如果你的应用反复用同一段长上下文(比如一份产品文档喂给多次对话),缓存读取只要标准输入价的十分之一,值得配置。

上下文窗口:1M 输入、6.4 万输出是怎么来的

官方模型页给出的精确数字是输入上限 1,048,576 token,输出上限 65,536 token。行业里习惯说"1M 上下文、6.4 万输出",就是把这两个数字四舍五入的结果,实际数字比整数略大一点,这是二进制对齐的常见写法(1,048,576 = 2 的 20 次方)。

1M token 大概能装下多少东西,给个直观参照:一个中型代码仓库(几百个文件、十几万行代码)压缩成纯文本,通常也就落在几十万到 100 万 token 这个区间,Gemini 3.7 Flash 一次调用理论上能把整个仓库塞进去做代码审查或者重构建议。65,536 token 的输出上限,换算成中文大概是十万字左右,长文档生成、长代码生成基本够用。

多模态输入这块,官方列的支持类型是文本、图片、视频、音频、PDF,输出只有文本。也就是说你可以丢一段视频进去问内容,但模型不会回你一段视频或音频,这个不对称经常被忽略。

免费层:能测试,别指望跑生产

免费层价格是 0 美元,这点官方定价页写得明确。但免费不等于随便用,频率限制卡得很紧。第三方测算给出的数字是每分钟约 10 次请求、每天约 1500 次请求、每分钟约 25 万 token,这组数字来自社区整理的免费层限额对比,Google 没有把具体 RPM/RPD 数值直接写进面向普通用户的定价页,实际额度请以你控制台里看到的为准。

付费层的请求频率会随累计消费提升,社区测算大致是:刚开通付费层 150 到 300 次每分钟,累计消费到一定门槛后能跳到 1000 次每分钟以上,企业级客户可以谈到自定义额度。这部分数字浮动比较大,不同账号、不同地区可能不一样,真要上生产环境,建议直接在 Google Cloud 控制台里查自己账号的实际配额,别照抄网上的数字。

调用示例:curl 和 Python 两种写法

先拿 API key。去 https://aistudio.google.com/apikey 申请,免费层不用绑卡就能拿到 key,这一步和之前几代 Gemini 没有变化。

curl 调用,最简单的文本生成:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "parts": [{"text": "用一句话解释什么是上下文缓存"}]
    }]
  }'

Python 的写法(用官方 google-genai SDK):

from google import genai

client = genai.Client(api_key="你的key")

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="用一句话解释什么是上下文缓存",
    config={"thinking_config": {"thinking_level": "low"}}
)

print(response.text)

thinking_level 支持 low、medium、high 三档(不支持 minimal,这点和部分老模型不同),级别越高推理越深但消耗的思考 token 也越多,对着上面那张价格表算,thinking 开到 high 的账单可能比 low 高出好几倍,按任务复杂度选档位,别无脑开满。

我的判断

这次限时半价本质上是一次抢市场份额的动作,2026 年底前把 Flash 系列的调用成本压到和竞品同档甚至更低,等用户和开发工具都接进来了,2027 年涨回原价的阻力自然就小了。如果你在做的项目本来就打算长期用 Gemini 系列,现在这半年确实是把大批量任务(批量摘要、批量代码审查、批量数据清洗)提前跑掉的窗口期,省下来的钱是实打实的。但如果只是短期测试或者小流量应用,涨价前后的差价可能没大到值得为此改架构,按实际需求接入就好,不用为了赶半价窗口硬凑用量。

免费层的频率限制是真实存在的坑,第一次接入时容易因为没算清楚 RPM 就被限流搞得莫名其妙,建议先在免费层跑通逻辑,确认要上量了再开付费层,别一上来就绑卡跑大流量测试。


参考

相关阅读

常见问题

Gemini 3.7 Flash 现在调用一次多少钱?
输入每百万 token 0.75 美元,输出(含思考 token)每百万 token 3.75 美元,这是 2026 年 12 月 31 日前的限时价;2027 年 1 月 1 日起分别涨到 1.50 美元和 7.50 美元。
免费层能直接拿来用吗?
可以先用免费层测试逻辑,输入输出都是 0 美元,但请求频率被限得很紧,第三方测算约为每分钟 10 次请求、每天 1500 次,跑生产流量基本撑不住,得升级到付费层。
上下文窗口到底能塞多少内容?
官方文档写的是输入上限 1,048,576 token、输出上限 65,536 token,通常说的 1M 输入、6.4 万输出就是这两个数字四舍五入的说法。
和上一代 Gemini 3.6 Flash 比区别在哪?
3.7 Flash 是 3.6 Flash 发布三周后就跟进的迭代版本,主打编程和 agentic 任务,价格结构没变,只是这次限时价把数字整体砍了一半。
调用时 model 参数怎么填?
gemini-3.7-flash 就行,在 Google AI Studio(aistudio.google.com/apikey)里能直接选这个模型,也能在那个页面申请 API key。
广告合作联系
立即联系 →
加入会员申请
了解详情 →
← GPU 云算力价格对比 2026: 国内 vs 海外每小时多 … vLLM 和 Ollama 怎么选:高并发场景实测对比 →
💬 Comments
5 min read