Más información sobre los modelos compatibles

En el caso de las apps para dispositivos móviles y la Web, los SDKs de Firebase AI Logic te permiten interactuar con los modelos de Gemini compatibles directamente desde tu app.

Los modelos Gemini se consideran multimodales porque son capaces de procesar y hasta generar múltiples modalidades, como texto, código, PDFs, imágenes, video y audio.

Además, consulta nuestras preguntas frecuentes sobre todos los modelos que admite y no admite Firebase AI Logic.

RÁPIDO E INTELIGENTE

gemini-3.6-flash

Rendimiento de clase Frontier que compite con modelos más grandes a una fracción del costo. (no se necesita facturación)

ULTRA RÁPIDA

gemini-3.5-flash-lite

Modelo de uso general de gran volumen y sensible a los costos con el rendimiento y la calidad de la serie Gemini 3. (no se necesita facturación)

GENERACIÓN DE IMÁGENES

gemini-3.1-flash-image

Modelo potente y de alta eficiencia para la generación y edición de imágenes, optimizado para la velocidad y los casos de uso de gran volumen. (se requiere facturación)

Modelos de uso general

Ir a las tablas con detalles del modelo

gemini-3.1-pro-preview

Inteligencia avanzada, habilidades para resolver problemas complejos y potentes capacidades de codificación de agentes y ambiente. (se requiere facturación)

gemini-3.6-flash

Rendimiento de clase Frontier que compite con modelos más grandes a una fracción del costo. (no se necesita facturación)

gemini-3.5-flash-lite

Modelo de uso general de gran volumen y sensible a los costos con el rendimiento y la calidad de la serie Gemini 3. (no se necesita facturación)

Modelos estables anteriores de uso general
  • Gemini 3.5 Flash (gemini-3.5-flash): Modelo Gemini 3.x Flash anterior para el rendimiento de la clase de frontera que compite con modelos más grandes a una fracción del costo. (no se necesita facturación)

  • Gemini 3.1 Flash‑Lite (gemini-3.1-flash-lite): Modelo Gemini 3.x Flash‑Lite anterior para tareas de uso intensivo y sensibles a los costos. (no se necesita facturación)

Modelos de generación de imágenes

Ir a las tablas con detalles del modelo

gemini-3-pro-image

Modelo de estado del arte para la generación y edición de imágenes que permite crear imágenes nativas altamente contextuales. (se requiere facturación)

gemini-3.1-flash-image

Modelo potente y de alta eficiencia para la generación y edición de imágenes, optimizado para la velocidad y los casos de uso de gran volumen. (se requiere facturación)

gemini-3.1-flash-lite-image

Modelo de edición y generación de imágenes rentable y de latencia ultrabaja, diseñado para casos de uso interactivos de gran volumen. (se requiere facturación)

Modelos de generación de audio

Puedes generar audio transmitido con modelos que admitan Gemini Live API.

Ir a la página con detalles del modelo

API de Gemini Developer: gemini-3.1-flash-live-preview

API de Gemini en Agent Platform: no admitido

Permite interacciones de voz y video en tiempo real y de baja latencia con un modelo de Gemini bidireccional. (no se necesita facturación)


API de Gemini Developer: gemini-2.5-flash-native-audio-preview-12-2025

API de Gemini en Agent Platform: gemini-live-2.5-flash-native-audio

Permite interacciones de voz y video en tiempo real y de baja latencia con un modelo de Gemini bidireccional. (no se necesita facturación)


En el resto de esta página, se proporciona información detallada sobre los modelos compatibles con Firebase AI Logic.

  • Compara modelos:

    • Entrada y salida admitidas
    • Comparación general de las capacidades admitidas
    • Especificaciones y limitaciones, por ejemplo, la cantidad máxima de tokens de entrada o la duración máxima del video de entrada
  • Descripción de cómo se versionan los modelos, específicamente sus versiones estable, de vista previa y experimental

  • Listas de nombres de modelos disponibles para incluir en tu código durante la inicialización

  • Listas de idiomas admitidos para los modelos

En la parte inferior de esta página, puedes ver información detallada sobre los modelos de generaciones anteriores.



Comparar modelos

Cada modelo tiene diferentes capacidades para admitir varios casos de uso. Ten en cuenta que cada una de las tablas de esta sección describe cada modelo cuando se usa con Firebase AI Logic. Cada modelo puede tener capacidades adicionales que no están disponibles cuando se usan nuestros SDKs.

Si no encuentras la información que buscas en las siguientes subsecciones, puedes encontrar aún más información en la documentación del proveedor de la API que elijas: Gemini Developer API o Agent Platform Gemini API (formerly Vertex AI).

Para obtener detalles completos sobre los modelos de Gemini Live API, consulta Límites y especificaciones de Live API.

Entrada y salida admitidas

En la siguiente tabla, se enumeran los tipos de entrada y salida admitidos cuando se usa cada modelo con Firebase AI Logic.

Para obtener información sobre los tipos de archivos admitidos, consulta Archivos de entrada y requisitos admitidos.

<span="notranslate">Gemini 3.x
Pro, Flash, Flash‑Lite </span="notranslate">
<span="notranslate">Gemini 3.x
Pro
Image </span="notranslate">
<span="notranslate">Gemini 3.x
Flash
Image </span="notranslate">
<span="notranslate">Gemini 3.x
Flash‑Lite
Image </span="notranslate">
Tipos de entrada
Texto
Código
Documentos
(PDF o texto sin formato)
Imágenes
Video
Audio
Tipos de salida
Texto
Texto (transmisión)
Código
Resultados estructurados
(como JSON)
Imágenes
Video
Audio

Funciones y capacidades admitidas

En la siguiente tabla, se enumeran las capacidades y funciones compatibles cuando se usa cada modelo con Firebase AI Logic.

<span="notranslate">Gemini 3.x
Pro, Flash, Flash‑Lite </span="notranslate">
<span="notranslate">Gemini 3.x
Pro
Image </span="notranslate">
<span="notranslate">Gemini 3.x
Flash
Image </span="notranslate">
<span="notranslate">Gemini 3.x
Flash‑Lite
Image </span="notranslate">
Pensamiento
Generar texto a partir de entradas de solo texto o multimodales Intercalado o como parte de la imagen Intercalado o como parte de la imagen Intercalado o como parte de la imagen
Genera imágenes
Editar imágenes
Generar audio
Genera resultados estructurados
(como JSON)
Analizar documentos
(PDF o texto sin formato)
(text-output | image-output)
Analiza imágenes
(text-output | image-output)
Analizar video
(text-output | image-output)
Analizar audio
Chat de varios turnos
Transmisión multimodal bidireccional
Herramientas compatibles
Llamada a función
Ejecución de código
Contexto de la URL
Fundamentación con Google Search
Fundamentación con Google Maps

Especificaciones y limitaciones

En la siguiente tabla, se enumeran las especificaciones y limitaciones cuando se usa cada modelo con Firebase AI Logic.

Propiedad <span="notranslate">Gemini 3.x
Pro, Flash, Flash‑Lite </span="notranslate">
<span="notranslate">Gemini 3.x
Pro
Image </span="notranslate">
<span="notranslate">Gemini 3.x
Flash
Image </span="notranslate">
<span="notranslate">Gemini 3.x
Flash‑Lite
Image </span="notranslate">
Límite de tokens de entrada * 1,048,576 tokens 65,536 tokens 131,072 tokens 65,536 tokens
Límite de tokens de salida * 65,536 tokens 32,768 tokens 32,768 tokens 4,096 tokens
PDFs (por solicitud)
Cantidad máxima
de archivos PDF de entrada **
900 archivos 14 archivos 14 archivos 14 archivos
Cantidad máxima
de páginas
por archivo PDF de entrada **
900 páginas 14 páginas 14 páginas 14 páginas
Tamaño máximo
por archivo PDF de entrada
50 MB 50 MB 50 MB 50 MB
Imágenes (por solicitud)
Cantidad máxima
de imágenes de entrada
1,000 imágenes 14 imágenes 14 imágenes 14 imágenes
Tamaño máximo
por imagen de entrada codificada en Base64
7 MB 7 MB 7 MB 7 MB
Cantidad máxima
de imágenes de salida
--- Hasta el límite de tokens de salida Hasta el límite de tokens de salida Hasta el límite de tokens de salida
Video (por solicitud)
Cantidad máxima
de archivos de video de entrada
10 archivos --- Hasta el límite de tokens de entrada Hasta el límite de tokens de entrada
Longitud máxima
de todo el video de entrada
(solo fotogramas)
60 minutos aprox. --- 25 minutos aprox. Aprox. 12 minutos
Longitud máxima
de todo el video de entrada
(fotogramas y audio)
45 minutos aprox. --- --- ---
Audio (por solicitud)
Cantidad máxima
de archivos de audio de entrada
1 archivo --- --- ---
Longitud máxima
de todo el audio de entrada
Aprox. 8.4 horas --- --- ---

* Para todos los modelos Gemini, un token equivale a alrededor de 4 caracteres, por lo que 100 tokens equivalen a entre 60 y 80 palabras en inglés. En el caso de los modelos Gemini, puedes determinar el recuento total de tokens en tus solicitudes con countTokens.

** Los PDFs se tratan como imágenes, por lo que una sola página de un PDF se considera una imagen. La cantidad de páginas permitidas en una solicitud se limita a la cantidad de imágenes que el modelo puede admitir.

Encuentra información detallada adicional



Patrones de nomenclatura y control de versiones de modelos

Los modelos se ofrecen en versiones estables, de vista previa y experimentales. Para mayor comodidad, se admiten los alias -latest, pero no se recomiendan debido a la incoherencia en la versión del modelo a la que apuntan.

Asegúrate de revisar nuestras prácticas recomendadas para usar versiones de modelos.

Para encontrar nombres de modelos específicos que puedes usar en tu código, consulta la sección "Nombres de modelos disponibles" más adelante en esta página.

Tipo de versión /
Etapa de lanzamiento
Descripción Patrón del nombre del modelo