統合されたマルチモーダルデータレイヤー
生のバイト、拡張された特徴量、メタデータ、埋め込みを同じテーブルに保存して扱えるため、データ型ごとに別のシステムを用意する必要がありません。
LanceDBは、データのキュレーション、特徴量エンジニアリング、混在データ検索、学習用データセット準備を支援するAIネイティブなマルチモーダルlakehouseです。Python API対応。
LanceDBは、さまざまなデータから学習用データセット、特徴量、検索システムを構築するチーム向けのAIネイティブなマルチモーダルlakehouseです。サイトでは、構造化メタデータ、埋め込み、ローデータを同じワークフローで扱いながら、キュレーション、特徴量エンジニアリング、検索、学習のための統一基盤として位置づけられています。
この製品は、脆弱な前処理スクリプトや断片化したツール群に頼らずに、実験段階から本番運用へ移行する手段として説明されています。エンタープライズ向けには検索、探索的データ分析、特徴量エンジニアリング、学習が組み合わされており、付属の`geneva` Pythonパッケージはデータロジックを定義・実行するための開発者向けAPIを提供します。
生のバイト、拡張された特徴量、メタデータ、埋め込みを同じテーブルに保存して扱えるため、データ型ごとに別のシステムを用意する必要がありません。
データ同期ジョブ、場当たり的なスクリプト、個別の特徴量ストアをつなぎ合わせるのではなく、1つのプラットフォームからキュレーション、特徴量エンジニアリング、検索、学習を実行できます。
scalar、batched、stateful関数を含む宣言的なPython UDFを使って特徴量ロジックを定義し、分散インフラ全体で実行できます。
埋め込みの更新、列の追加、書き込みのバージョン管理、実験ブランチの作成、テーブルを複製したり再書き込みしたりせずにデータセットのロールバックができます。
同じテーブルに対して、ベクトル検索、全文検索、ハイブリッド検索をSQLフィルターと組み合わせて、検索と探索を行えます。
RayとKubeRayを使い、バックフィル、前処理、特徴量生成、推論関連ジョブなどのワークロードをCPUとGPUにまたがってスケールできます。
重複行の削除、ラベル付けのためのエッジケース特定、データ準備と学習を同じシステム内で維持することで、大規模な学習用データセットを準備できます。
Pythonの特徴量ロジックをローカルで定義し、その後、特徴量パイプラインの自動更新、バージョニング、バックフィルとともに大規模に適用できます。
単一のテーブル上でベクトル、全文、ハイブリッドの検索を実行し、本番検索、RAG、その他のエージェント型検索ワークフローに活用できます。
探索的データ分析と本番データセットの反復に同じプラットフォームを使うことで、データを複製せずにバリアントの比較や実験のブランチ分岐ができます。
RayとKubeRayを使って、前処理、推論関連ジョブ、その他の分散ワークロードをCPUとGPUにまたがってスケールできます。
LanceDBは、検索、探索的データ分析、特徴量エンジニアリング、学習を1つのプラットフォームで組み合わせたAIネイティブなマルチモーダルlakehouseとして紹介されています。提供資料では、ローデータ、埋め込み、メタデータ、SQLベースの探索への統一されたアクセスが強調されています。
提供資料では、Multimodal LakehouseスイートがLanceDB Enterpriseの一部として説明されており、開発者向けのAPIとして`geneva` Pythonパッケージを使用することが示されています。ブログでは、ユーザーはUDFを含む標準的なPython関数として特徴量ロジックを定義できるとも説明されています。
提供資料のホームページでは、キュレーション、特徴量エンジニアリング、学習、検索と取得が強調されています。また、ベクトル検索、全文検索、ハイブリッド検索、SQLフィルター、自動バージョニング、増分更新、分散実行にも言及しています。
提供資料で確認できる価格ページは、公開価格表ではなく問い合わせフォームです。フォームへの入力を促し、チームが48時間以内に返信すると記載されています。
ダウンロードページには、SOC 2 Type II、GDPR、HIPAAについてのエンタープライズグレードのコンプライアンスに関する記載があります。これらの主張は、提供資料内では詳細な信頼性ページではなくリソースページに表示されています。