LAIONは、公開研究向けにオープンな機械学習データセット、モデル、ツールを提供する非営利組織です。大規模な画像テキスト資源とデータセット構築ツールが中心です。

LAION preview

概要

LAION(Large-scale Artificial Intelligence Open Network)は、公開利用のためにデータセット、コード、機械学習モデルを公開する非営利組織です。サイトでは、この組織を 100% オープン、100% 非営利、100% 無料と説明しており、機械学習リソースを一般の人々が利用できるようにすることに重点を置いています。

この組織のプロジェクトは、大規模な画像テキストデータセット、オープンなモデル実装、学習データの構築や分析を支援するツールを中心に展開しています。LAION は、その活動が研究者による既存データセットやモデルの再利用、教育支援、重複する学習作業と資源使用の削減に役立つことを意図していると述べています。

LAION が提供するもの

大規模な公開データセット

サイトでは、LAION-400M や LAION-5B などの大規模データセットが紹介されており、これらは機械学習研究向けの画像テキストコレクションです。

オープンモデルの公開

LAION は、`OpenCLIP`、`ClipCap`、`CLAP`、`Multilingual-CLIP` などのオープンモデルを維持しており、対照学習、生成、マルチモーダルの研究タスクをカバーしています。

データセットと検索ツール

プロジェクトページには、画像ソースのダウンロード、データセットの構築、CLIP 埋め込みの取り扱いに使える `img2dataset` や `Clip Retrieval` などのユーティリティが含まれています。

コンテンツのフィルタリングと検出

LAION は、データセットおよびモデルのエコシステムの一部として、透かし検出や NSFW 検出を含むフィルタや検出器の取り組みも掲載しています。

メタデータ中心のワークフロー

FAQ では、LAION のデータセットは URL とテキストメタデータの索引であり、LAION から元のメディアファイルを受け取るのではなく、必要なデータはユーザーが再構築すると説明されています。

オープン研究の配布

この組織は、大規模機械学習研究をより再利用しやすく、一般にアクセスしやすくするために、データセット、コード、モデルを公開していると述べています。

LAION が適している場面

  • マルチモーダルモデルの学習やベンチマーク

    研究者は、マルチモーダル機械学習の作業を学習、ベンチマーク、再現するための出発点として、LAION が公開したデータセットやモデルを利用できます。

  • Web リンクソースからのデータセット構築

    データパイプラインを構築するチームは、`img2dataset` と関連プロジェクトのツールを使って、URL ベースのソースからデータセットのサブセットを再構築し、実験用にパッケージ化できます。

  • CLIP ベースの検索ワークフローの実行

    画像検索や埋め込みワークフローに取り組む実務者は、`Clip Retrieval` と CLIP 関連の公開物を使って埋め込みを計算し、類似検索を試すことができます。

  • データセット内容のフィルタリングや分類

    有害または望ましくないコンテンツを懸念する組織や貢献者は、データセットのフィルタリング作業の一環として、透かし検出や NSFW 検出などの LAION の検出プロジェクトを確認できます。

  • オープンな研究資産の再利用

    オープンソースのマルチモーダル基盤に関心のある研究者は、公開研究向けの再利用可能なコンポーネントとして、LAION のデータセット、モデル、ツールの組み合わせを調べることができます。

Pros and Cons

Pros

  • 大規模なデータセット、モデル、ツールへの公開アクセスを 1 か所で提供しています。
  • 公開済み、開始済み、計画中、進行中の作業にわたって、プロジェクトの状態が明確に示されています。
  • 著作権、データセットの再構築、GDPR の削除要請について、FAQ で実用的なガイダンスを提供しています。
  • データセット構築や検索ツールなど、コアな研究資産と支援ユーティリティの両方をカバーしています。

Cons

  • 標準的な料金ページやプランはサイト上に表示されておらず、/pricing URL は現在 404 を返します。
  • 多くのプロジェクト項目はステータスベースの一覧であるため、一部の提供内容は詳細なドキュメントではなく概略レベルでしか説明されていません。

FAQ

LAION のデータセットはどのように機能しますか?

LAION は、データセットをウェブへの索引として扱っていると説明しています。つまり、保存された元のメディアのコピーではなく、URL と関連する代替テキストやキャプションの一覧です。また、研究者は関心のあるサブセットをダウンロードして必要なデータを再構築するとしており、そのワークフローには `img2dataset` を推奨しています。

LAION は著作権に関する懸念にどのように対応していますか?

FAQ では、LAION は非営利の研究組織であり、EU およびドイツの TDM 例外の下で著作物を研究目的で利用することが認められていると説明しています。また、LAION はデータセット内に元の画像、音声、動画を保存していないとも述べています。

データセットに自分の個人データが含まれている場合、どうすればよいですか?

FAQ によると、LAION は、データセットのメタデータやリンク先コンテンツに名前や画像などの個人データが表示されている場合、検証可能な申請に対する GDPR の削除手続きを提供しています。LAION が管理するデータリポジトリからはエントリを削除できますが、管理外で流通している過去のリリースまでは削除できないと記載されています。

LAION はどのような種類のプロジェクトを維持していますか?

プロジェクトページには、公開済み、開始済み、計画中、進行中の作業が混在して表示されています。これには、`LAION-5B`、`OpenCLIP`、`img2dataset`、`Clip Retrieval` などのデータセット、モデル、ツールが含まれます。

LAION は利用に料金を請求しますか?

LAION は、寄付と公的な研究助成金によって資金提供される非営利組織だと説明しています。また、サイトではその活動を 100% 無料で一般公開されているものとして示しています。

Quick Facts

カテゴリ
オープン AI 研究組織
主な焦点
機械学習研究向けのデータセット、モデル、ツール
ビジネスモデル
寄付と公的研究助成金で運営される非営利
アクセス
100% 無料かつ公開と表記
Webサイト
laion.ai
代表的な成果物の種類
画像テキストデータセットとオープンソースの ML プロジェクト