Gemini

gemini-3.1-flash-lite

Google按量计费
别名:gemini-3.1-flash-lite-preview

Google 的 gemini-3.1-flash-lite 模型,支持文本、图像、音频、视频、文件输入和文本输出。支持推理、工具调用、结构化输出。

textimageaudiovideofilecachingcode_interpreterfunction_callingtoolsweb_searchstructured_outputjson_modereasoningvisioncontext:1048576
起始价格
输入 / 输出 · 1M
上下文
1M
最大输入窗口
最大输出
65.5K
单次响应最大 token 数
模态
→
发布于
May 2026

按供应商定价

Google AI Studio
省50%
谷歌官方接口
输入$0.25$0.125/ 1M
输出$1.5$0.75/ 1M
缓存读取$0.025$0.0125/ 1M
Google Vertex
省30%
谷歌官方接口
输入$0.25$0.175/ 1M
输出$1.5$1.05/ 1M
缓存读取$0.025$0.0175/ 1M

能力 / 支持的模态

提示词缓存代码解释器函数调用工具网络搜索结构化输出JSON 模式推理视觉
输入
输出

厂商与数据隐私

厂商
Google文档
分词器
SentencePiece (Gemini)
许可证
Proprietary (commercial)商业闭源
数据保留78 天默认不会用于上游训练

性能

关于 gemini-3.1-flash-lite

Google 的 gemini-3.1-flash-lite 模型,支持文本、图像、音频、视频、文件输入和文本输出。支持推理、工具调用、结构化输出。

使用场景与提示词

以下内容用于开始评估;支持的输入与选项请查看 API 接入模块。

可探索的使用场景

  • 明确受众、语气和格式要求,起草并修改文本。
  • 总结提供的文档,并与原始资料核对回答。

实用建议

将指令与原始材料分开,描述预期输出并提供示例。仅在明确支持时测试工具调用或结构化输出。

提示词示例

请用五个要点总结以下文档。区分已确认的事实和待解答的问题,引用相关段落,不要编造缺失信息。文档:[粘贴你的文本]

接入 API

调用示例

请求POST/v1beta/models/gemini-3.1-flash-lite:generateContent
请求示例
参数
参数类型默认值 / 范围说明信息
temperature
number
=10 ~ 2
采样温度;越低越稳定
top_p
number
=10 ~ 1
核采样累计概率
max_tokens
integer>= 1响应中最大 token 数
frequency_penalty
number
=0-2 ~ 2
惩罚高频 token 的重复出现
presence_penalty
number
=0-2 ~ 2
鼓励引入新话题
stop
array—最多 4 个停止生成的字符串
seed
integer—尽量保证可复现的采样种子
n
integer
=1>= 1
生成的候选条数
stream
boolean
=false
通过 SSE 流式返回 token
response_format
object—强制输出 JSON 对象或符合 Schema 的结果
tools
array—模型可调用的工具 / 函数声明
tool_choice
string
autononerequired
工具选择策略或具体工具名
logprobs
boolean
=false
返回每个 token 的对数概率
top_logprobs
integer0 ~ 20每个 token 返回的 top 概率数量
logit_bias
object—按 token 的 logit 偏置映射
user
string—用于风险审计的终端用户标识

替换 <YOUR_API_KEY> 替换为令牌设置中的 API Key。

身份验证

所有请求必须携带 Authorization: Bearer <TOKEN> 请求头。Anthropic 格式的端点也接受 x-api-key 请求头。

在「令牌」页面生成 API Key,可以按模型、分组、IP、速率等维度精细化授权。

支持的参数

Generation parameters
参数类型默认值 / 范围说明信息
temperature
number
=10 ~ 2
采样温度;越低越稳定
top_p
number
=10 ~ 1
核采样累计概率
max_tokens
integer>= 1响应中最大 token 数
frequency_penalty
number
=0-2 ~ 2
惩罚高频 token 的重复出现
presence_penalty
number
=0-2 ~ 2
鼓励引入新话题
stop
array—最多 4 个停止生成的字符串
seed
integer—尽量保证可复现的采样种子
n
integer
=1>= 1
生成的候选条数
stream
boolean
=false
通过 SSE 流式返回 token
response_format
object—强制输出 JSON 对象或符合 Schema 的结果
tools
array—模型可调用的工具 / 函数声明
tool_choice
string
autononerequired
工具选择策略或具体工具名
logprobs
boolean
=false
返回每个 token 的对数概率
top_logprobs
integer0 ~ 20每个 token 返回的 top 概率数量
logit_bias
object—按 token 的 logit 偏置映射
user
string—用于风险审计的终端用户标识

速率限制

供应商RPMTPMRPD
default380154K7.7K
Google AI Studio920369K19K
Google Vertex550219K11K

RPM = 每分钟请求数,TPM = 每分钟 token 数,RPD = 每日请求数。限制按令牌分组生效。

关于 gemini-3.1-flash-lite 的常见问题

gemini-3.1-flash-lite 是什么?

Google 的 gemini-3.1-flash-lite 模型,支持文本、图像、音频、视频、文件输入和文本输出。支持推理、工具调用、结构化输出。

如何调用 gemini-3.1-flash-lite?

创建具有 gemini-3.1-flash-lite 访问权限的 API 密钥,然后使用 API 接入模块中的准确模型 ID 和受支持的接口。请求字段取决于所选接口。

gemini-3.1-flash-lite 如何计费?

费用取决于所选供应商分组和模型计费单位。注册前即可在本页查看当前输入、输出、单次请求或媒体价格。

gemini-3.1-flash-lite 的上下文窗口有多大?

模型目录配置的上下文窗口为 1048576 tokens。具体请求限制请查看所选接口。

gemini-3.1-flash-lite 的最大输出是多少?

模型目录配置的最大输出为 65536 tokens。请求设置可能指定更低的上限。

如何评估 gemini-3.1-flash-lite 是否适合我的项目?

将指令与原始材料分开,描述预期输出并提供示例。仅在明确支持时测试工具调用或结构化输出。