AIおよびRAG検索のためのQuattro Proスプレッドシートアーカイブの準備
AI、データ、ナレッジマネジメントチームがプライベートRAGシステムを構築するためのもの。

要点
LLMおよびRAGパイプラインは、.wq1、.wq2、.wb2、または.qpwファイルを直接インデックスすることはできません。レガシースプレッドシートは、パイプラインに入る前にローカルでCSV、Markdown、およびXLSXに変換してください。CSVおよびMarkdownは、埋め込みと検索に最適な入力です。XLSXおよびPDFは、モデルに表示される内容の人間によるレビューをサポートします。
AIは読めないものは使えない
ほとんどのリトリーバルおよび埋め込みパイプラインは、古いスプレッドシートのバイナリを静かにスキップします。その結果、会社の実際の知識の一部から質問に自信を持って答えるプライベートRAGシステムが生まれます—しばしば何が除外されたのか誰も気づかないままです。
アーカイブの近代化は、地味だが必要な前提条件です:クリーンでオープンなフォーマットが、従来のフォーマットが隠していたスプレッドシートの履歴を解放します。
RAGに最適なターゲット形式
一. タブラ埋め込みのためのCSV
CSV は最もクリーンな表形式の入力です。各行は小さく予測可能なチャンクになり、列は自然なメタデータになります。CSV を行レベルのメタデータと組み合わせて、年、エンティティ、または元のブックでフィルタリングするためにインデックスに使用します。
二. ナラティブタブ用のMarkdown
多くのQuattro Proノートブックには、前提条件、変更履歴、エグゼクティブサマリーなどのナラティブタブが含まれています。MarkdownはHTMLやPDFのテキストよりもLLMのトークン化に適しているため、変換後の引用にはサマリータブの方が適しています。
三. XLSX および PDF を人間が確認
レビュアーがモデルに何が表示されたかを確認する必要がある場合、XLSX と PDF が彼らの期待するフォーマットです。モデルの引用を視覚的に遡れるように、CSV/Markdown の隣に置いておいてください。
会話を非公開にしてください
アーカイブに財務、顧客、従業員、または運用データが含まれる場合、変換はクラウドAIのステップの前に行うべきであり、できればRAGパイプラインの他の部分がホストされている同じ管理された環境内で行うのが望ましいです。
無料のオンラインコンバーターは、プライバシーを重視するAIシステムにとって不適切な依存です。それらは、プライベートなLLMが排除するよう設計されている正確にそのデータ居住性の問題を再び持ち込んでしまいます。
後で役立つインデックス作成のコツ
変換中にファイルごとのメタデータを取得します:ソースパス、出力パス、元の拡張子、変換タイムスタンプ、およびフォルダ構造から推測できるプロジェクト、年、またはエンティティ。これらのメタデータをフィルタ可能なフィールドとしてベクターストアにプッシュします。
アーカイブをRAG対応と宣言する前に、いくつかの既知の歴史的な質問に対してサンプルテストを実施する。適切な質問は、インデックスに入れる必要があるタブや仮定をしばしば明らかにする。
部分的なアーカイブにRAGを構築するのをやめてください
プライベートLLMの賢さは、見ることができるコーパスに依存します。レガシーのスプレッドシートアーカイブを一度変換し、メタデータでインデックス化し、モデルに会社が実際に知っていることをついに読ませましょう。
関連記事
レガシーQuattro ProアーカイブをあなたのプライベートAIコーパスの一部にする
代表的なアーカイブで試行Quattro Pro Converterを行い、RAGパイプラインへの取り込み準備ができたCSV、Markdown、XLSX、およびPDFの出力を生成します。
無料トライアル
アプリ全機能 — 最大 10 ファイル
Windows 10 または 11
Windows インストーラー をダウンロードして、最大 10 ファイルのフル機能トライアルを利用できます。ライセンスで解除するのと同じアプリ — PC 上で 100% ローカル。
オフライン MSI · 同一のトライアル機能