Cuando quieras ejecutar un modelo de Gemma, debes tomar dos decisiones clave: 1) qué variante de Gemma quieres ejecutar y 2) qué framework de ejecución de IA usarás para ejecutarla. Un problema clave para tomar estas decisiones tiene que ver con el hardware que tú y tus usuarios tienen disponible para ejecutar el modelo.
Esta descripción general te ayuda a tomar estas decisiones y comenzar a trabajar con los modelos de Gemma. Los pasos generales para ejecutar un modelo de Gemma son los siguientes:
- Elige un framework para ejecutar
- Selecciona una variante de Gemma
- Ejecuta solicitudes de generación e inferencia
Elige un framework
Los modelos de Gemma son compatibles con una amplia variedad de herramientas del ecosistema. Elegir la adecuada depende del hardware disponible (GPU de Cloud o laptop local) y de tu preferencia de interfaz (código de Python o aplicación de escritorio).
Usa la siguiente tabla para identificar rápidamente la mejor herramienta para tus necesidades:
| If you want to... | Recommended Framework | Best For |
|---|---|---|
| Ejecutar de forma local con una IU de chat | - LM Studio - Ollama |
Principiantes o usuarios que desean una experiencia similar a Gemini en su laptop |
| Ejecutar de manera eficiente en Edge | - LiteRT-LM - llama.cpp - MLX |
Inferencia local de alto rendimiento con recursos mínimos |