開発者は、'!PREDICT' メソッドを使用して Document AI の抽出プロセスを改良しており、請求書の JSON 出力('請求書番号'、'請求書項目'、'税額'、'ベンダー名' を含む)を綿密に調べています。また、抽出する '製品詳細' の詳細な内部テーブルも用意しています。抽出された情報のデータ品質を最適化し、正確な解釈を保証するために、開発者は Document AI の出力の以下のベストプラクティスまたは特性のうち、どれを考慮すべきでしょうか?
正解:B,C
オプション A は誤りです。「_documentMetadata」フィールドの「ocrScore」は、そのドキュメントの光学文字認識 (OCR) 「プロセス」の信頼度スコアを指定するものであり、抽出された特定の値の信頼度を指定するものではありません。個々の抽出値に関連付けられた「score」フィールドは、その特定の値の信頼度を示します。オプション B は正しいです。ドキュメント AI モデルはリストを返すことができ、「invoice_items」フィールドは例として示されています。「invoice_items」の JSON 形式は、複数のアイテムのオブジェクトの配列を示します。このようなリスト抽出では、順序は本質的に維持されます。オプション C は正しいです。ソースでは、テーブル抽出では、JSON 出力の値がテーブルの行と同じ順序で提供されるため、列を簡単に結合できることが明示的に述べられています。これにより、抽出されたテーブルデータの構造的整合性が保証されます。オプション D は誤りです。質問の最適化には、具体的かつ正確であることが不可欠です。ガイドラインでは、「日付は何ですか?」のような一般的な質問をしないようにアドバイスしています。ドキュメント AI は意図を推測したり、拡張されたドメイン知識を持つことが期待されていないため、特に類似した値が複数存在する可能性がある場合は、詳細を含めずに表示します。オプション E は誤りです。ドキュメント AI モデルが回答を見つけられない場合 (たとえば、そのフィールド内で 'value' キーをまったく返さないなど)、回答が存在しないという確信度を示す 'score' キーは返します。