大型公開資料集
網站將 LAION 描述為大規模資料集的來源,例如 LAION-400M 與 LAION-5B,這些是供機器學習研究使用的圖文集合。
LAION(Large-scale Artificial Intelligence Open Network)是一個非營利組織,對外發布可供大眾使用的資料集、程式碼與機器學習模型。其網站將該組織描述為 100% 開放、100% 非營利、100% 免費,重點在於讓機器學習資源可供一般大眾使用。
該組織的專案聚焦於大型圖文資料集、開放模型實作,以及用於建立或分析訓練資料的支援工具。LAION 表示,其工作旨在協助研究人員重複使用既有資料集與模型、支援教育,並減少重複訓練所耗費的努力與資源。
網站將 LAION 描述為大規模資料集的來源,例如 LAION-400M 與 LAION-5B,這些是供機器學習研究使用的圖文集合。
LAION 維護多個開放模型,包括 `OpenCLIP`、`ClipCap`、`CLAP` 與 `Multilingual-CLIP`,涵蓋對比式、生成式與多模態研究任務。
專案頁面包含 `img2dataset` 與 `Clip Retrieval` 等工具,可用於下載圖片來源、建立資料集,以及處理 CLIP embeddings。
LAION 也列出過濾與偵測相關工作,包括浮水印偵測與 NSFW 偵測,作為其資料集與模型生態的一部分。
FAQ 說明 LAION 資料集是 URL 與文字 metadata 的索引,使用者會自行重建所需資料,而不是從 LAION 直接取得原始媒體檔案。
該組織表示會發布資料集、程式碼與模型,讓大規模機器學習研究更容易被重複使用,並對大眾更具可及性。
研究人員可以使用 LAION 已發布的資料集與模型,作為訓練、基準測試或重現多模態機器學習工作的起點。
建立資料管線的團隊可使用 `img2dataset` 與相關專案工具,從基於 URL 的來源重建資料集子集,並將其封裝以供實驗。
從事影像檢索或 embedding 工作流程的實務者,可使用 `Clip Retrieval` 與 CLIP 相關發布項目來計算 embeddings 並探索相似度搜尋。
關注有害或不需要內容的組織或貢獻者,可以檢視 LAION 的偵測專案,例如浮水印與 NSFW 偵測,作為資料集過濾工作的一部分。
對開源多模態基礎架構有興趣的研究人員,可以探索 LAION 的資料集、模型與工具組合,將其作為可重複使用的公共研究元件。
LAION 表示其資料集是網路的索引:包含 URL 清單及相關替代文字或說明文字,而非原始媒體的儲存副本。它也表示研究人員可透過下載自己有興趣的子集來重建所需資料,並建議使用 `img2dataset` 來完成這個流程。
FAQ 說明 LAION 是非營利研究組織,並且在歐盟與德國的 TDM 例外規定下,允許為研究目的使用受版權保護的內容。它也指出 LAION 的資料集不儲存原始圖片、音訊或影片。
根據 FAQ,如果個人資料出現在資料集中,LAION 提供 GDPR 下架流程,適用於可驗證的請求,例如名稱或影像出現在資料集 metadata 或連結內容中。它也說明可移除其所控制的資料儲存庫中的項目,但無法移除其控制範圍之外流通的過往版本。
專案頁面顯示的工作狀態涵蓋已發布、已開始、規劃中與進行中。這包括資料集、模型與工具,例如 `LAION-5B`、`OpenCLIP`、`img2dataset` 與 `Clip Retrieval`。
LAION 將自己描述為由捐款與公共研究補助資助的非營利組織。網站也將其工作定位為 100% 免費且向大眾開放。