ターミナル
curl -X POST https://sotaocr.com/v1/extract \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "file=@document.pdf"
常に最高品質
SotaOCR
95%
Google Vision
82%
Azure OCR
79%
Tesseract
61%
100 以上の言語日本語への高い対応力
抽出できるもの
あらゆる PDF から LLM が必要とするすべて
テキストとレイアウト
複雑な多段組 PDF -> 構造を保ったクリーンな Markdown
# Annual Report 2024 Revenue grew **23%** year-over-year...
表
結合セルを含む複雑な表 -> きれいに構造化された Markdown 表
| Metric | Q1 | Q2 | |----------|-------|-------| | Revenue | $12M | $15M |
画像と数式
数式表記 -> LaTeX。埋め込み画像 -> 抽出ファイル
$$E = mc^2$$
$$\int_0^\infty e^{-x^2} dx$$バウンディングボックス
ページ上の各検出要素に対する正確な座標
{"type": "table", "bbox": [42, 180, 520, 340], "confidence": 0.97}LLM エージェントに最適なサービス
REST API と SDK。主要な AI ツール向けのそのまま使える skills。
🟠
Claude
Anthropic 向け MCP Skill
🟢
Codex
OpenAI ツール
⚡
Cursor
MCP 連携
比較
| 機能 | SotaOCR | Azure | Tesseract | |
|---|---|---|---|---|
| テキスト抽出 | 最高水準 | 良い | 良い | 普通 |
| 表認識 | 最高水準 | 普通 | 良い | 弱い |
| 数式(LaTeX) | ||||
| バウンディングボックス | ||||
| 1 ページあたりの価格 | $0.003 | $0.015 | $0.01 | 無料(OSS) |