更多文章

AI 与开发者相关深度内容

Gemini 3.6 Flash 正式发布:API 价格、上下文、能力与 Copilot 接入

Last checked: 2026-07-22

Google 已在 2026 年 7 月 21 日更新开发者文档,gemini-3.6-flash 已进入 Gemini API 的 Stable 模型列表。开发团队现在可以核对三项直接影响预算和集成的变化:标准输出价格从 Gemini 3.5 Flash 的每百万 tokens 9 美元降到 7.5 美元;模型保留 1,048,576 tokens 输入窗口和 65,536 tokens 输出上限;同一天 GitHub 开始把它逐步开放给 Copilot 的多个付费套餐。

不过,“Stable 模型”并不等于所有附属能力都已经正式商用。Google 的模型页把 Computer Use 单独标为 Preview,GitHub 的企业管理员也需要启用名为 Gemini 3.6 Flash Preview 的策略。页面层级不同、发布状态不同,如果只写一句“Gemini 3.6 Flash 全面上线”,就会把 API 稳定性、工具成熟度和第三方产品灰度混成一个结论。

先看官方快照:模型 ID、窗口、模态和价格

项目 2026-07-22 官方状态 对工程决策的含义
API 模型 ID gemini-3.6-flash,Stable 生产配置应固定到明确模型 ID,不只使用模糊的 latest 别名
输入 文本、图片、视频、音频、PDF 多模态输入可用,但输出仍是文本
输入上限 1,048,576 tokens 是容量上限,不是建议把仓库或文档一次塞满
输出上限 65,536 tokens 输出计费包含 thinking tokens
标准价格 输入 $1.50 / 输出 $7.50,每 1M tokens 适合交互式和低延迟请求的基准预算
Batch / Flex 输入 $0.75 / 输出 $3.75,每 1M tokens 便宜一半,但需要接受相应的执行与时延条件
Priority 输入 $2.70 / 输出 $13.50,每 1M tokens 是高优先级服务费率,不应拿来代表默认价格
上下文缓存 读取 $0.15 / 1M tokens;存储 $1.00 / 1M tokens / 小时 读取费和按小时存储费必须分别估算
Search / Maps grounding Gemini 3 系列共享每月 5,000 个免费 prompts,之后每 1,000 次搜索查询 $14 一个 prompt 可能触发多次可计费查询

这些数据来自 Google AI 的 Gemini 3.6 Flash 模型页官方价格页,访问日期均为 2026 年 7 月 22 日。模型页还明确支持 caching、code execution、file search、function calling、Maps grounding、Search grounding、structured outputs、thinking 与 URL context;不支持音频生成、图片生成和 Live API。Computer Use 虽可用,但状态仍是 Preview。

这意味着 3.6 Flash 可以承接“读取多个文件、调用函数、执行代码、检索网页并生成结构化结果”这类 agent 循环,但不能因为名字里有 Flash,就默认它能替代实时语音模型、图片生成模型或稳定版桌面操作模型。开发者应按任务调用链选择模型,而不是按一个家族名称选择全部能力。

与 Gemini 3.5 Flash 相比,价格到底降了多少

同一张官方价格表中,Gemini 3.5 Flash 的标准价格是每百万输入 tokens 1.5 美元、每百万输出 tokens 9 美元。3.6 Flash 的输入价没有变化,输出价降低 1.5 美元,输出行降幅约 16.7%。Batch 和 Flex 的 3.6 输出价为 3.75 美元,3.5 为 4.5 美元,同样体现了输出侧下调。

不能据此直接得出“整项任务便宜 16.7%”。实际账单取决于输入输出比、thinking tokens、重试、上下文缓存、grounding 查询和工具调用。一个主要读取大量上下文、只输出很短答案的任务,成本降幅会明显小于 16.7%;一个反复生成长补丁和长解释的编码 agent,输出价下降的影响才更明显。

还有一个容易遗漏的细节:Google 明确把 thinking tokens 计入输出。团队如果只记录最终可见文本,会低估真实的输出用量。评估脚本至少要保存 API usage 字段、失败请求、自动重试次数和 grounding 查询数,而不是只在月底看总账单。

仓库级编码 Agent:20 个任务的成本与回归门禁

假设一个维护 Python 服务的团队要比较 Gemini 3.6 Flash 与现有的 Gemini 3.5 Flash。它不拿“写一个贪吃蛇”做演示,而是从真实 backlog 中抽取 20 个任务:10 个带明确验收条件的 issue、5 个当前会失败的测试、5 个跨文件重构。所有任务固定到同一个 Git commit,只允许 agent 在临时分支写入,网络权限、系统提示、工具列表和超时保持一致。

为了先做预算,团队给每个任务设定 80,000 输入 tokens 和 12,000 输出加 thinking tokens 的上限。20 个任务合计 1.6M 输入和 240,000 输出 tokens。按 Gemini 3.6 Flash 标准价计算:

输入:1.6 x $1.50 = $2.40
输出:0.24 x $7.50 = $1.80
基础模型费用:$4.20

按 Gemini 3.5 Flash 的同页价格计算,输入仍为 2.40 美元,输出为 0.24 x $9.00 = $2.16,合计 4.56 美元。纸面差额只有 0.36 美元。此时,如果 3.6 Flash 少一次失败重试、少 10 分钟人工 review,节省的人力价值可能远大于 token 差额;如果它因为更积极的工具调用产生额外搜索或无关 diff,纸面降价也可能被抵消。

验收维度 记录方式 通过条件 暂停信号
任务完成 运行每个 issue 的验收命令 至少 16/20 达到预先写明的验收 任务通过率低于旧模型且差异无法解释
回归安全 目标测试加相关模块回归 不破坏已有测试 修改无关模块或跳过失败测试
Diff 质量 统计文件数、行数、无关格式变化 无关 diff 为 0 大范围重写或删除保护代码
工具安全 保存命令、退出码、网络请求 无越权写入和危险命令 试图访问密钥、生产库或执行破坏命令
人工成本 记录 reviewer 分钟数 平均每任务不超过 12 分钟 token 省了但 review 时间明显上升
稳定性 连续 7 天复跑一组固定任务 超时和 429 可解释且在预算内 模型 ID、配额或输出风格持续漂移

这 20 个任务把模型费用和交付费用放在同一张表里。测试通过率、无关 diff、人工复核时间和重试都会改变总成本;只对比每百万 token 单价,常常会选到“调用便宜但使用更贵”的模型。

一百万上下文不是让你一次上传整个仓库

1,048,576 tokens 的输入上限给长文档、多文件仓库、长视频和大量日志留出了空间,但接近上限的请求会带来三个工程问题。第一,输入本身仍要付费,1M tokens 按标准价约 1.5 美元,还没有计算输出和缓存。第二,相关信息占比下降后,模型可能更难稳定找到真正需要修改的文件。第三,大请求失败或重试时,成本和时延会被整块放大。

更稳的做法是先建立仓库地图:目录职责、入口文件、依赖、测试命令和最近 diff;再按任务检索相关文件,把必要上下文控制在可解释范围内。只有归档审查、全库迁移或跨大量文件的依赖分析,才值得逐步扩大窗口。即使使用缓存,也要计算存储时长。官方价格中的每百万缓存 tokens 每小时 1 美元意味着,长时间保留一个巨大缓存并非免费。

对于 PDF、音视频和图片也一样。支持某种输入类型,只证明 API 接受它,不证明任何分辨率、时长和语言组合都具有同等质量。团队应保存样本规格:页数、时长、帧率、语言、扫描质量和是否包含表格。没有输入规格,所谓“多模态表现更好”无法复核。

Copilot 已开始开放,但不是所有账户同时出现

GitHub 7 月 21 日的更新称,Gemini 3.6 Flash 正在逐步进入 GitHub Copilot,目标套餐包括 Pro、Pro+、Max、Business 和 Enterprise。可选择入口覆盖 Visual Studio Code、Visual Studio、Copilot CLI、GitHub Copilot cloud agent、Copilot app、JetBrains、Xcode 和 Eclipse。

“正在逐步开放”意味着模型选择器里暂时看不到,并不能证明账号配置错误。Business 与 Enterprise 管理员还需要在 Copilot 设置中启用 Gemini 3.6 Flash Preview policy。这里再次出现了层级差异:Google API 把基础模型列为 Stable,GitHub 对其 Copilot 集成仍使用 Preview 策略。企业团队做采购或合规记录时,应分别保存 Google 模型页、GitHub 策略页和组织管理员配置,而不是只截一张 IDE 模型选择器。

GitHub 表示其早期测试中,3.6 Flash 在编码和 agent 工作流上比 3.5 Flash 有更高任务完成率和更好的 token 效率,同时支持可配置 reasoning effort 与并行工具使用。但这篇 changelog 没有公开完整任务集、样本量和失败分布。因此正文可以准确转述“GitHub 报告了早期测试结果”,不能改写成“RadarAI 实测全面领先”。

哪些团队适合现在测试,哪些应先等

适合立即建立小规模评测的团队有三类:已经使用 Gemini 3.5 Flash 且输出成本明显的团队;需要长上下文、文件搜索、结构化输出和函数调用组合的 agent 团队;在 Copilot 中维护真实多文件项目、能够保存任务基线的工程组。它们拥有明确旧模型、日志和验收命令,切换成本可测。

应该先等的场景包括:依赖 Live API 或原生音频生成;把 Computer Use 当作正式 SLA 能力;没有固定回归集却准备全量替换;对区域、数据保留或组织策略尚未完成审查。没有回滚条件时,把预览工具带进关键流程会放大发布日风险。

发布后 14 天应该持续记录什么

第一,记录 Google 模型页和价格页是否修订;Stable ID 通常不变,但配额、免费层和 grounding 计费可能更新。第二,记录 GitHub 的 rollout 范围与组织策略是否从 Preview 调整。第三,保存自己的任务级 usage,而不是只保存总费用。第四,把失败样本分成模型推理、工具调用、外部服务、限流和提示问题,避免把全部失败归给模型。

如果官方模型卡、API 文档和产品集成页面出现不一致,以各自负责的层级解释:模型卡回答训练与安全范围,API 文档回答调用能力与限制,Copilot 页面回答第三方产品可用性。不要从其中一层跨推另一层的 SLA。

常见问题

Gemini 3.6 Flash 是正式发布还是 Preview?

Gemini API 模型页把 gemini-3.6-flash 标为 Stable。与此同时,Computer Use 仍标为 Preview,GitHub Copilot 的企业策略也使用 Preview 字样。正确说法是基础 API 模型已稳定发布,但部分工具和第三方集成仍有各自的预览或渐进开放状态。

Gemini 3.6 Flash 的上下文多大?

官方模型页列出 1,048,576 tokens 输入上限和 65,536 tokens 输出上限。上限不是推荐用量,成本、相关性和失败重试仍需控制。

它比 Gemini 3.5 Flash 便宜吗?

标准输入价相同,都是每百万 tokens 1.5 美元;3.6 Flash 的标准输出价为 7.5 美元,3.5 Flash 为 9 美元。整项任务是否更便宜,还取决于输出量、thinking、重试、缓存、grounding 与人工复核。

GitHub Copilot 为什么还看不到?

GitHub 明确说明 rollout 是渐进式的。企业和商业版管理员还需要开启对应策略。如果套餐符合但暂时没有出现,应先检查管理员策略和 rollout 状态,而不是直接判断产品未发布。

RadarAI 是否已经独立跑过性能测试?

没有。本文核对的是官方文档、价格和 GitHub 发布说明,并提供可复现的内部测试任务包。任何性能结论都应在读者自己的仓库、权限和验收条件下复跑。

官方与一手来源

继续阅读

← 返回更多文章