圖像解讀

Gemini 模型從一開始就建構於多模態的基礎上,因此可執行各種圖像處理和電腦視覺工作,包括但不限於生成圖像說明文字、分類和回答圖像問題,無須訓練專門的機器學習模型。

除了提供一般多模態功能,Gemini 模型還透過額外訓練,針對特定用途 (例如物件偵測區隔) 提升準確度

將圖片傳送給 Gemini

你可以透過下列幾種方式,將圖片做為 Gemini 的輸入內容:

使用網址傳遞圖片

您可以使用 Files API 上傳圖片,並在要求中傳遞圖片:

Python

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="path/to/organ.jpg")

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input=[
        {"type": "text", "text": "Caption this image."},
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        }
    ]
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const uploadedFile = await client.files.upload({
    file: "path/to/organ.jpg",
    config: { mimeType: "image/jpeg" }
});

const interaction = await client.interactions.create({
    model: "gemini-3.8-flash",
    input: [
        {type: "text", text: "Caption this image."},
        {
            type: "image",
            uri: uploadedFile.uri,