L'API Gemini Interactions è un'API sperimentale che consente agli sviluppatori di creare applicazioni di AI generativa utilizzando i modelli Gemini. Gemini è il nostro modello più potente, sviluppato da zero per essere multimodale. È in grado di generalizzare e di comprendere, gestire e combinare senza problemi diversi tipi di informazioni, tra cui linguaggio, immagini, audio, video e codice. Puoi utilizzare l'API Gemini per casi d'uso come il ragionamento su testo e immagini, la generazione di contenuti, gli agenti di dialogo, i sistemi di riepilogo e classificazione e altro ancora.
Creare un'interazione
Crea una nuova interazione.
Corpo della richiesta
Il corpo della richiesta contiene dati con la seguente struttura:
model ModelOption (facoltativo)
Il nome del modello utilizzato per generare l'interazione.
Obbligatorio se non viene fornito "agent".
Valori possibili:
-
gemini-2.5-computer-use-preview-10-2025Un modello di funzionalità agentiche progettato per l'interazione diretta con l'interfaccia, che consente a Gemini di percepire e navigare negli ambienti digitali.
-
gemini-2.5-flashIl nostro primo modello di ragionamento ibrido che supporta una finestra contestuale da 1 milione di token e dispone di budget di pensiero.
-
gemini-2.5-flash-imageIl nostro modello nativo di generazione di immagini, ottimizzato per velocità, flessibilità e comprensione contestuale. L'input e l'output di testo hanno lo stesso prezzo di 2,5 Flash.
-
gemini-2.5-flash-liteIl nostro modello più piccolo ed economico, creato per l'utilizzo su larga scala.
-
gemini-2.5-flash-lite-preview-09-2025L'ultimo modello basato su Gemini 2.5 Flash Lite ottimizzato per costi contenuti, throughput elevato e alta qualità.
-
gemini-2.5-flash-native-audio-preview-12-2025I nostri modelli audio nativi ottimizzati per output audio di qualità superiore con un ritmo, una naturalezza della voce, un livello di dettaglio e un tono migliori.
-
gemini-2.5-flash-preview-09-2025Il modello più recente basato sul modello 2.5 Flash. 2.5 Flash Preview è ideale per l'elaborazione su larga scala, la bassa latenza, le attività ad alto volume che richiedono ragionamento e i casi d'uso con agenti.
-
gemini-2.5-flash-preview-ttsIl nostro modello Text-to-Speech 2.5 Flash è ottimizzato per la generazione di sintesi vocale potente, controllabile e a bassa latenza.
-
gemini-2.5-proIl nostro modello multiuso all'avanguardia, che eccelle nella programmazione e in attività di ragionamento complesse.
-
gemini-2.5-pro-preview-ttsIl nostro modello audio Text-to-Speech 2.5 Pro ottimizzato per una generazione di voce potente e a bassa latenza per output più naturali e prompt più facili da gestire.
-
gemini-3-flash-previewIl nostro modello più intelligente, creato per la velocità, che combina intelligenza all'avanguardia con ricerca e grounding superiori.
-
gemini-3-pro-image-previewModello all'avanguardia per la generazione e la modifica di immagini.
-
gemini-3-pro-previewIl nostro modello più intelligente con ragionamento e comprensione multimodale all'avanguardia, nonché potenti funzionalità di codifica di agenti e vibe coding.
-
gemini-3.1-pro-previewIl nostro ultimo modello di ragionamento SOTA con una profondità e una sfumatura senza precedenti, nonché potenti funzionalità di comprensione multimodale e programmazione.
-
gemini-3.1-flash-image-previewIntelligenza visiva di livello professionale con efficienza alla velocità di Flash e funzionalità di generazione basate sulla realtà.
-
gemini-3.1-flash-lite-previewIl nostro modello più conveniente, ottimizzato per attività agentiche ad alto volume, traduzione ed elaborazione di dati semplici.
-
gemini-3.1-flash-tts-previewGemini 3.1 Flash TTS: generazione di sintesi vocale potente e a bassa latenza. Goditi output naturali, prompt orientabili e nuovi tag audio espressivi per un controllo preciso della narrazione.
-
lyria-3-clip-preview