Get Started

フレームワーク

Trunkbaseが、雑然としたドキュメントを整理された構造化ノートへと変え、あなたのAIのためにそれをホストする方法を、すべてあなたのマシン上で行います。Trunkbaseは、人が読むのと同じようにドキュメントを読み、レイアウト・表・テキストを認識し、完全にあなた自身のマシン上で動作する機械学習を使ってこれを実現します。クラウドも、アップロードも、アカウントも不要です。

ドキュメントは不透明なファイルとして入り、出てくるのは整理された、検索可能で構造化されたナレッジであり、完全にあなたのものです。最新の機械学習の知性と、ローカルファーストアプリのプライバシーを兼ね備えています。

text
Decompose → Store → Find → Compose. Private by default.

分解パイプライン

Trunkbaseは「まずスマートパーサー、必要なところにAI」というアプローチを採用しています。すべてにAIを使うのではなく、各ファイルに適切なツールを適用することで、高速かつ正確、そしてプライベートに保ちます。

  • PDFはページ構造も含めて直接解析されます。
  • Officeファイル(Word、PowerPoint、Excel)は専用のリーダーを通して処理されます。
  • HTMLは実際のコンテンツだけになるようクリーンアップされます。
  • Markdownとプレーンテキストはそのまま通過します。

🧠 ニューラルによるレイアウト理解

PDFや画像については、オンデバイスのレイアウトモデルが、ページの構造を識別します。どこが見出しで、段落で、キャプションで、段組みなのかを見分け、テキストを読み取り順序が崩れたまま吐き出すことはありません。変換後のドキュメントは元の形を保ちます。

📊 AIによる表認識(TableFormer)

表こそ、ほとんどの変換ツールが破綻するところです。TrunkbaseはTableFormerという、表の行・列・結合セルを再構築するために専用に作られた機械学習モデルを使用します。そのため、PDFの中の財務表が、数字の寄せ集めではなく、本物の使える表になります。

🔎 スマートOCR — 必要なときだけ

TrunkbaseはいつAIを使うかについて賢く判断します。まず、PDFにすでに読み取り可能なテキストが含まれているかを確認します。

  • ボーンデジタルPDF(テキストレイヤーあり)→ 直接読み取り、OCRオフ。高速かつ正確です。
  • スキャンされたPDFや画像(ピクセルのみ)→ オンデバイスOCRにエスカレーションしてテキストを認識します。

この「必要なときだけエスカレーション」という設計により、AIは価値を生む箇所でのみ的確に使われ、決して無駄に使われることはありません。

⚡ 賢く決定論的に

Word、PowerPoint、Excel、HTML、プレーンテキストは、正確で決定論的なパーサーによって読み取られます。構造がすでに分かっているため、AIによる推測は不要です。プレーンテキストはモデルをまったく使わずにそのまま通過します。

本当に曖昧な部分だけがローカルの機械学習モデルにエスカレーションされます。難しいレイアウトにはPyTorchのレイアウトモデルと表認識モデルが、そしてスキャンされたページや画像にはRapidOCRが使われます。大部分は決定論的なパーサーが処理し、モデルは難しい5%を担います。

内部の仕組み

分解されたノートは埋め込みベクトルに変換され、ローカルのLanceDBインデックスに保存されます。検索はハイブリッドで、キーワード(BM25)とベクトル類似度を融合させ、さらにオプションでナレッジグラフからの3つ目のシグナルも加えられます。ナレッジグラフはnetworkxで投影されます。すべてがオンデバイスで動作します。クラウドLLMはあくまでオプトインの、自分の鍵を持ち込む追加機能であり、依存対象になることは決してありません。

オープンソースで構築

Trunkbaseはオープンソースコミュニティの成果の上に成り立っています。私たちのプライバシーの約束が信頼に足るのは、その土台となる技術がオープンで監査可能であり、謎めいたクラウドサービスではないからです。Trunkbaseを可能にしているプロジェクトを、感謝とともにご紹介します。

ドキュメントインテリジェンス

  • Docling(IBM)— 私たちの分解エンジンを支えるドキュメント理解の基盤です。ニューラルによるレイアウト解析と、TableFormerによる表認識モデルを提供します。
  • PyTorch— オンデバイスのレイアウトモデルと表モデルを動かす機械学習ランタイムです。
  • RapidOCR— スキャンされたページや画像向けの、高速なオンデバイス光学文字認識です。

検索とナレッジ

  • LanceDB— ハイブリッドなセマンティック検索を支える、組み込み型のベクトル+キーワードデータベースです。
  • FastEmbed(Qdrant)— 効率的なローカルテキスト埋め込みです。
  • NetworkX— ボールトナレッジグラフを支えるグラフエンジンです。

アプリの基盤

書体とデザイン