Ejecuta la generación de contenido y las inferencias de Gemma

Cuando quieras ejecutar un modelo de Gemma, debes tomar dos decisiones clave: 1) qué variante de Gemma quieres ejecutar y 2) qué framework de ejecución de IA usarás para ejecutarla. Un problema clave para tomar estas decisiones tiene que ver con el hardware que tú y tus usuarios tienen disponible para ejecutar el modelo.

Esta descripción general te ayuda a tomar estas decisiones y comenzar a trabajar con los modelos de Gemma. Los pasos generales para ejecutar un modelo de Gemma son los siguientes:

Elige un framework

Los modelos de Gemma son compatibles con una amplia variedad de herramientas del ecosistema. Elegir la adecuada depende del hardware disponible (GPU de Cloud o laptop local) y de tu preferencia de interfaz (código de Python o aplicación de escritorio).

Usa la siguiente tabla para identificar rápidamente la mejor herramienta para tus necesidades:

If you want to... Recommended Framework Best For
Ejecutar de forma local con una IU de chat - LM Studio
- Ollama
Principiantes o usuarios que desean una experiencia similar a Gemini en su laptop
Ejecutar de manera eficiente en Edge - LiteRT-LM
- llama.cpp
- MLX
Inferencia local de alto rendimiento con recursos mínimos