Gemini 模型從一開始就建構於多模態的基礎上,因此可執行各種圖像處理和電腦視覺工作,包括但不限於生成圖像說明文字、分類和回答圖像問題,無須訓練專門的機器學習模型。
除了提供一般多模態功能,Gemini 模型還透過額外訓練,針對特定用途 (例如物件偵測和區隔) 提升準確度。
將圖片傳送給 Gemini
你可以透過下列幾種方式,將圖片做為 Gemini 的輸入內容:
- 使用網址傳遞圖片:適合公開存取的圖片。
- 傳遞內嵌圖片資料:適用於採用 Base64 編碼的圖片資料。
- 使用 File API 上傳圖片:建議用於較大的檔案,或在多個要求中重複使用圖片。
使用網址傳遞圖片
您可以使用 Files API 上傳圖片,並在要求中傳遞圖片:
Python
from google import genai
client = genai.Client()
uploaded_file = client.files.upload(file="path/to/organ.jpg")
interaction = client.interactions.create(
model="gemini-3.8-flash",
input=[
{"type": "text", "text": "Caption this image."},
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
}
]
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const uploadedFile = await client.files.upload({
file: "path/to/organ.jpg",
config: { mimeType: "image/jpeg" }
});
const interaction = await client.interactions.create({
model: "gemini-3.8-flash",
input: [
{type: "text", text: "Caption this image."},
{
type: "image",
uri: uploadedFile.uri,