メインコンテンツまでスキップ

抽出オプション

PROOFがファイルから表を抽出する方法をカスタマイズしてください。

モデル選択​

基本モデルとプレミアムモデルから選択してください:

モデルフラグデフォルト備考
基本ocr_model=basic—$0.001/ページ、1日100ページまで無料、音声/動画非対応
プレミアムocr_model=premium✓$0.005/ページ、すべてのファイルタイプに対応
curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@document.pdf" \
-F "ocr_model=basic"

OCRエンジン​

プレミアムモデルの場合、テキスト抽出に使用するOCRエンジンを選択してください:

エンジンフラグデフォルト備考
EasyOCRocr_engine=easyocr✓速度と精度のバランス
Tesseractocr_engine=tesseract—高速で広くサポート
RapidOCRocr_engine=rapidocr—CJKテキストに最適化
curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@document.pdf" \
-F "ocr_model=premium" \
-F "ocr_engine=rapidocr"

カラム​

モデルの抽出をガイドするためにカラム名を指定します。省略するとデフォルトカラムが使用されます。

カンマ区切り​

curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@document.pdf" \
-F "columns=日付,勘定科目,摘要,入金額,出金額,残高"

JSON配列​

curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@document.pdf" \
-F 'columns=["date","account","description","debit","credit","balance"]'

プロンプト​

モデルの抽出動作をカスタマイズする追加指示を入力します。

curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@document.pdf" \
-F "prompt=金額が1,000,000以上の行のみ抽出してください"

一般的なプロンプト例:

  • "複数行セルを単一セルにマージ"
  • "ヘッダー行を無視してデータ行のみ抽出"
  • "YYYY-MM-DD日付形式を使用"
  • "行番号カラムを含める"

DPI​

PDFページのレンダリング解像度を制御します。DPIが高いほど小さなテキストの精度が向上しますが、処理時間が増加します。

DPIユースケース
150デフォルト、ほとんどの文書に適切
300高解像度、小さなフォント
600非常に細かい文字、レシート
curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@document.pdf" \
-F "dpi=300"

相対パス(アーカイブ用)​

アーカイブをアップロードする際、ディレクトリ構造を維持するために相対パスを指定できます:

curl -X POST https://your-domain.com/api/v1/jobs/upload \
-H "X-API-Key: chu_live_xxxxxxxx" \
-F "files=@archive.zip" \
-F 'relative_paths=["folder/doc1.pdf","folder/doc2.pdf"]'