SotaOCR

AI エージェントと LLM パイプライン向けの PDF 認識サービス

初期費用は不要。わずか $0.003/ページ。 数秒でドキュメントを構造化データに変換します。

ターミナル
curl -X POST https://sotaocr.com/v1/extract \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "file=@document.pdf"

常に最高品質

SotaOCR
95%
Google Vision
82%
Azure OCR
79%
Tesseract
61%
100 以上の言語日本語への高い対応力

抽出できるもの

あらゆる PDF から LLM が必要とするすべて

テキストとレイアウト

複雑な多段組 PDF -> 構造を保ったクリーンな Markdown

# Annual Report 2024

Revenue grew **23%** year-over-year...

結合セルを含む複雑な表 -> きれいに構造化された Markdown 表

| Metric   | Q1    | Q2    |
|----------|-------|-------|
| Revenue  | $12M  | $15M  |

画像と数式

数式表記 -> LaTeX。埋め込み画像 -> 抽出ファイル

$$E = mc^2$$
$$\int_0^\infty e^{-x^2} dx$$

バウンディングボックス

ページ上の各検出要素に対する正確な座標

{"type": "table", "bbox": [42, 180, 520, 340], "confidence": 0.97}

LLM エージェントに最適なサービス

REST API と SDK。主要な AI ツール向けのそのまま使える skills。

スキルをダウンロード
🟠
Claude
Anthropic 向け MCP Skill
🟢
Codex
OpenAI ツール
Cursor
MCP 連携

比較

機能
SotaOCR
GoogleAzureTesseract
テキスト抽出
最高水準
良い良い普通
表認識
最高水準
普通良い弱い
数式(LaTeX)
バウンディングボックス
1 ページあたりの価格
$0.003
$0.015$0.01無料(OSS)

始める準備はできましたか?

無料で試す

クレジットカード不要