大规模公共数据集
网站将 LAION 介绍为大规模数据集的来源,例如 LAION-400M 和 LAION-5B,这些图文集合面向机器学习研究。
LAION,即 Large-scale Artificial Intelligence Open Network,是一个非营利组织,向公众发布数据集、代码和机器学习模型供使用。其网站将该组织描述为 100% 开放、100% 非营利、100% 免费,重点是让机器学习资源可供大众使用。
该组织的项目主要围绕大规模图文数据集、开放模型实现,以及用于构建或分析训练数据的支持工具。LAION 表示,其工作旨在帮助研究人员复用现有数据集和模型,支持教育,并减少重复训练所需的工作和资源消耗。
网站将 LAION 介绍为大规模数据集的来源,例如 LAION-400M 和 LAION-5B,这些图文集合面向机器学习研究。
LAION 维护开放模型,包括 `OpenCLIP`、`ClipCap`、`CLAP` 和 `Multilingual-CLIP`,覆盖对比式、生成式和多模态研究任务。
项目页面包含 `img2dataset` 和 `Clip Retrieval` 等工具,用于下载图像来源、构建数据集以及处理 CLIP embedding。
LAION 还列出了过滤器和检测器方面的工作,包括水印检测和 NSFW 检测,作为其数据集和模型生态的一部分。
FAQ 解释说,LAION 数据集是 URL 和文本元数据的索引,用户会自行重建所需数据,而不是从 LAION 接收原始媒体文件。
该组织表示,它发布数据集、代码和模型,以使大规模机器学习研究更易复用并向公众开放。
研究人员可以使用 LAION 发布的数据集和模型,作为训练、基准测试或复现多模态机器学习工作的起点。
构建数据管道的团队可以使用 `img2dataset` 及相关项目工具,从基于 URL 的来源重建数据集子集,并将其打包用于实验。
从事图像检索或 embedding 工作流的实践者可以使用 `Clip Retrieval` 和与 CLIP 相关的发布内容来计算 embedding 并探索相似度搜索。
对有害或不受欢迎内容感到担忧的组织或贡献者,可以查看 LAION 的检测器项目,例如水印和 NSFW 检测,作为数据集过滤工作的一部分。
对开源多模态基础设施感兴趣的研究人员,可以探索 LAION 的数据集、模型和工具组合,将其作为公众研究的可复用组件。
LAION 表示,其数据集是面向网络的索引:由 URL 列表以及对应的替代文本或标题组成,并不是原始媒体文件的存储副本。它还表示,研究人员会通过下载自己感兴趣的子集来重建所需数据,并建议使用 `img2dataset` 完成这一流程。
FAQ 表示,LAION 是一家非营利研究组织,并且根据欧盟和德国的 TDM 例外规定,它可以出于研究目的使用受版权保护的材料。FAQ 还说明,LAION 不会在其数据集中存储原始图像、音频或视频。
根据 FAQ,如果某个数据集中出现了个人数据,例如姓名或图像出现在数据集元数据或关联内容中,LAION 提供 GDPR 下架流程以处理可验证的请求。FAQ 指出,它可以从其控制的数据仓库中移除条目,但无法移除已在其控制之外流传的历史版本。
项目页面展示了已发布、已启动、规划中和进行中的多种工作。这包括数据集、模型和工具,例如 `LAION-5B`、`OpenCLIP`、`img2dataset` 和 `Clip Retrieval`。
LAION 将自己描述为一家由捐赠和公共研究资助支持的非营利组织。网站也将其工作定位为对公众 100% 免费且开放。