视觉理解与索引
将图像和视频转化为结构化、可搜索的表示,并具备对象、动作、场景和事件识别,以及适用于长视频的时间分段功能。
Reka 是一家多模态 AI 公司,正在为视频、图像、音频和文本构建模型与基础设施。网站展示了一系列模型,包括 Spark、Edge、Flash 和 Core,以及用于推理、视觉理解和训练数据生成的产品。
其公开产品体系围绕 Reka Vision 进行组织,用于视频和图像内容的搜索与推理;infer 用于多模态推理;Claru 用于构建训练数据。Reka Labs 还发布面向物理 AI 和边缘部署的研究与开源权重模型。
将图像和视频转化为结构化、可搜索的表示,并具备对象、动作、场景和事件识别,以及适用于长视频的时间分段功能。
支持对图像和视频进行自然语言搜索,包括跨帧和跨场景检索,以及长时段事件发现。
可从长视频中生成精彩片段、摘要和剪辑,并基于用户意图进行精彩内容检测,且使用语音识别生成字幕。
通过对跨时间的视觉内容进行推理来回答复杂问题,包括多步推理、基于时间的查询以及跨模态问题。
介绍了一个面向多模态 AI 的推理引擎和 API,专为速度、规模和企业级可靠性而构建。
提供开源权重的 Edge 模型和部署文档,包括本地使用和 API 访问,并附带模型卡、快速入门和集成示例。
按语义而非元数据搜索大型视频库,然后提取精彩片段、摘要或剪辑供审核或发布。
从摄像头画面中检测打斗、游荡、盗窃、交通事件及其他事件,然后为操作人员提供告警和摘要报告。
检查工厂车间中的安全问题或装配线异常,并基于摄像头分析生成结构化事件报告。
在边缘端运行用于机器人、车辆或可穿戴设备的多模态模型,以满足低延迟和离线运行需求。
基于第一人称视频、机器人轨迹、世界模型镜头和专家人工判断构建训练数据集,用于前沿 AI 工作流。
Reka Vision 旨在实现对大规模视频和图像内容的视觉理解与搜索。来源将其描述为一个可理解、搜索并推理视觉内容的多模态 AI 系统。
来源称 Reka Vision 支持视觉理解与索引、语义视频搜索、精彩片段和剪辑生成,以及视觉推理和问答。它还将对实时画面监控和告警作为平台定位的一部分。
Reka Labs 提供开源权重的 7B 视觉语言模型,并说明它们可以在本地运行或通过 API 使用。产品网站还提到 Edge 模型的部署示例,例如 HF 和 vLLM。
该网站将 Reka 定位为面向企业、创作者和开发者,适用于工业与制造、实体安全和智慧城市、媒体与娱乐、汽车与远程信息处理、扩展现实以及国防等场景。
定价页面未显示有效的价格信息,而是返回了未找到消息。联系页面则引导有兴趣的用户请求演示或通过电子邮件联系公司。