データ処理チームは、Snowflake Document AI を使用して、仕入先からの請求書からデータを抽出しています。多くのドキュメントの処理が失敗し、抽出が成功した場合でも予想以上に時間がかかり、コストが増加していることに気づきました。調査の結果、次のようなエラーメッセージが見つかりました。 さらに、彼らの「X-LARGE仮想倉庫」は常に稼働しており、予想以上の請求額につながっています。これらの処理エラーの根本原因をトラブルシューティングして対処し、ドキュメントAIパイプラインを最適化するために不可欠な手順は次のうちどれですか?(2つ選択)
正解:B,D
エラーメッセージ「ドキュメントのページ数が多すぎます。実際: 130。最大: 125。」と「ファイルが最大サイズを超えています。実際: 54096026 バイト。最大: 50000000 バイト」は、ドキュメントが Document AI の入力要件(最大 125 ページ、ファイルサイズ 50 MB)を満たしていないことを直接示しています。したがって、これらのドキュメントを分割またはサイズ変更する前処理ステップを実装することが不可欠な解決策です (オプション B)。エラー「画像ファイル < io.ByteslO オブジェクト (Ox...) を識別できません」は、Document AI で使用される内部ステージが暗号化で構成されていない場合に発生する既知の問題です。この暗号化タイプでステージを正しく構成することが、この処理エラーを解決するために重要です (オプション D)。オプション A はコスト最適化に対応していますが、「処理エラー」自体の根本原因ではありません。ただし、大規模なデータウェアハウスでは Document AI クエリの処理速度が向上しないため、コスト管理のベストプラクティスです。オプション C は誤りです。質問の最適化のベストプラクティスでは、一般的ではなく具体的であることが推奨されています。オプションEは誤りです。「max_tokenS」はモデルの出力の長さに関係するもので、入力ドキュメントのサイズやページ制限とは関係ありません。