機能リスト

現在、Vision API では次の機能を使用できます。

すべての機能タイプ

テキスト検出

道路標識の画像
  • 画像の光学式文字認識(OCR)によって、テキストを認識し、マシンコード化されたテキストへ変換します。画像内の UTF-8 テキストを識別して抽出します。
  • 画像: 大きな画像内のテキストのスパース領域向けに最適化されます。
  • レスポンス: テキストとして識別された単語、境界ボックス、textAnnotations のリストに加え、OCR で検出されたテキスト(fullTextAnnotation)の構造的階層を返します。
    • 抽出されたテキスト構造の階層:
      • TextAnnotation -> Page -> Block -> Paragraph -> Word -> Symbol
      • Page 以降の各構造要素には、検出された言語、区切りなどの独自のプロパティがある場合があります。
  • サポートされている言語: 現在サポートされている言語、マッピングされている言語、試験運用版の言語で動作します。
  • 機能の列挙値: TEXT_DETECTION

ドキュメント テキスト検出(高密度テキスト / 手書き)

アノテーション付き高密度テキストの画像
手書き画像
  • ファイル(PDF / TIFF)または高密度テキスト画像用の光学式文字認識(OCR)によって、高密度テキストを認識し、マシンコード化されたテキストに変換します。
  • ファイル: ドキュメント ファイル(PDF / TIFF)向けに最適化されます。
  • 画像: 画像内(文書の画像)の高密度テキスト領域と、手書き文字を含む画像向けに最適化されます。
  • レスポンス: OCR で検出されたテキスト(fullTextAnnotation)の構造的階層を返します。
    • 抽出されたテキスト構造の階層:
      • TextAnnotation -> Page -> Block -> Paragraph -> Word -> Symbol
      • Page 以降の各構造要素には、検出された言語、区切りなどの独自のプロパティがある場合があります。
  • サポートされている言語: 現在サポートされている言語、マッピングされている言語、試験運用版の言語で動作します。
  • 機能の列挙値: DOCUMENT_TEXT_DETECTION
    • DOCUMENT_TEXT_DETECTIONTEXT_DETECTION の両方がリクエストされた場合に優先されます。

ランドマーク検出 1

聖ワシリイ大聖堂の画像
  • ランドマークの名称、信頼スコア、ランドマークの画像の境界ボックスを提供します。
  • 検出されたエンティティの座標を返します。

ロゴ検出 2

アノテーション付きロゴ
  • ファイル内のロゴで識別されたエンティティに関するテキスト形式の説明、信頼スコア、境界ポリゴンを提供します。

ラベル検出 3

上海通りの画像
  • 画像の一般化されたラベルを提供します。
  • ラベルごとにテキスト形式の説明、信頼スコア、トピカリティ評価を返します。

画像プロパティ 4

バリ島のプロパティ付き画像
  • 画像のドミナント カラーを返します。
  • 各色は RGBA 色空間で表され、信頼スコアを持ち、色 [0, 1] が占めるピクセルの割合を表示します。

オブジェクトのローカライズ 5

境界ボックスを含む画像
  • 1 つの画像で認識される複数のオブジェクトの一般的なラベルと境界ボックスのアノテーションを提供します。
  • 検出されたオブジェクトごとに、テキスト形式の説明、信頼スコア、オブジェクトの周囲の境界ポリゴンの正規化された頂点 [0,1] が返されます。