8 月 13 日,Google 把 Gemini 3.7 Flash 放出来了,离上一代 3.6 Flash 发布才过去三周。最扎眼的不是模型本身,是价格:输入每百万 token 0.75 美元,输出 3.75 美元,比标准价直接砍掉一半。这个折扣不是长期福利,写在官方定价页上的原话是"通过 2026 年 12 月 31 日",过了这个日子自动涨回 1.50 美元和 7.50 美元。
这篇把价格、上下文限制、免费层实际能用到什么程度,还有一段能直接跑的调用代码都放齐,省得你自己翻文档拼凑。
价格表:限时价和 2027 年后的正常价
Google 官方定价页把这次的优惠期限写得很清楚,截至我 8 月 16 日核对时是这样:
| 项目 | 2026-12-31 前(限时价) | 2027-01-01 起(标准价) |
|---|---|---|
| 输入(每百万 token) | 0.75 美元 | 1.50 美元 |
| 输出含思考 token(每百万 token) | 3.75 美元 | 7.50 美元 |
| Batch API 输入 | 0.375 美元 | 0.75 美元 |
| Batch API 输出 | 1.875 美元 | 3.75 美元 |
| 上下文缓存读取 | 0.075 美元 | 0.15 美元 |
| 上下文缓存存储(每百万 token/小时) | 0.50 美元 | 1.00 美元 |
| 免费层输入/输出 | 0 美元 | 0 美元(长期不变) |
限时价覆盖 Google AI Studio 和 Gemini Enterprise Agent Platform 两条路径,不是 AI Studio 专属福利。输出价格里明确包含思考 token,也就是说开了 thinking 模式后模型内部推理消耗的 token 也按输出价计费,这个坑很多人第一次算账时会漏掉。
Batch API 走的是异步批处理,价格是标准价的一半,适合不要求实时返回的场景,比如批量打标签、批量摘要。上下文缓存这块,如果你的应用反复用同一段长上下文(比如一份产品文档喂给多次对话),缓存读取只要标准输入价的十分之一,值得配置。
上下文窗口:1M 输入、6.4 万输出是怎么来的
官方模型页给出的精确数字是输入上限 1,048,576 token,输出上限 65,536 token。行业里习惯说"1M 上下文、6.4 万输出",就是把这两个数字四舍五入的结果,实际数字比整数略大一点,这是二进制对齐的常见写法(1,048,576 = 2 的 20 次方)。
1M token 大概能装下多少东西,给个直观参照:一个中型代码仓库(几百个文件、十几万行代码)压缩成纯文本,通常也就落在几十万到 100 万 token 这个区间,Gemini 3.7 Flash 一次调用理论上能把整个仓库塞进去做代码审查或者重构建议。65,536 token 的输出上限,换算成中文大概是十万字左右,长文档生成、长代码生成基本够用。
多模态输入这块,官方列的支持类型是文本、图片、视频、音频、PDF,输出只有文本。也就是说你可以丢一段视频进去问内容,但模型不会回你一段视频或音频,这个不对称经常被忽略。
免费层:能测试,别指望跑生产
免费层价格是 0 美元,这点官方定价页写得明确。但免费不等于随便用,频率限制卡得很紧。第三方测算给出的数字是每分钟约 10 次请求、每天约 1500 次请求、每分钟约 25 万 token,这组数字来自社区整理的免费层限额对比,Google 没有把具体 RPM/RPD 数值直接写进面向普通用户的定价页,实际额度请以你控制台里看到的为准。
付费层的请求频率会随累计消费提升,社区测算大致是:刚开通付费层 150 到 300 次每分钟,累计消费到一定门槛后能跳到 1000 次每分钟以上,企业级客户可以谈到自定义额度。这部分数字浮动比较大,不同账号、不同地区可能不一样,真要上生产环境,建议直接在 Google Cloud 控制台里查自己账号的实际配额,别照抄网上的数字。
调用示例:curl 和 Python 两种写法
先拿 API key。去 https://aistudio.google.com/apikey 申请,免费层不用绑卡就能拿到 key,这一步和之前几代 Gemini 没有变化。
curl 调用,最简单的文本生成:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{"text": "用一句话解释什么是上下文缓存"}]
}]
}'
Python 的写法(用官方 google-genai SDK):
from google import genai
client = genai.Client(api_key="你的key")
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="用一句话解释什么是上下文缓存",
config={"thinking_config": {"thinking_level": "low"}}
)
print(response.text)
thinking_level 支持 low、medium、high 三档(不支持 minimal,这点和部分老模型不同),级别越高推理越深但消耗的思考 token 也越多,对着上面那张价格表算,thinking 开到 high 的账单可能比 low 高出好几倍,按任务复杂度选档位,别无脑开满。
我的判断
这次限时半价本质上是一次抢市场份额的动作,2026 年底前把 Flash 系列的调用成本压到和竞品同档甚至更低,等用户和开发工具都接进来了,2027 年涨回原价的阻力自然就小了。如果你在做的项目本来就打算长期用 Gemini 系列,现在这半年确实是把大批量任务(批量摘要、批量代码审查、批量数据清洗)提前跑掉的窗口期,省下来的钱是实打实的。但如果只是短期测试或者小流量应用,涨价前后的差价可能没大到值得为此改架构,按实际需求接入就好,不用为了赶半价窗口硬凑用量。
免费层的频率限制是真实存在的坑,第一次接入时容易因为没算清楚 RPM 就被限流搞得莫名其妙,建议先在免费层跑通逻辑,确认要上量了再开付费层,别一上来就绑卡跑大流量测试。
参考
- Gemini API Pricing | Google AI for Developers
- What’s new in Gemini 3.7 Flash | Google AI for Developers
- Google’s Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut | VentureBeat
- Google releases Gemini 3.7 Flash for coding and agents | Datanorth
- Gemini API Free Tier Rate Limits 2026 | AI Free API