视觉理解与索引
将图像和视频转化为结构化、可搜索的表示,并具备对象、动作、场景和事件识别,以及适用于长视频的时间分段功能。
Reka 是一家多模态 AI 公司,正在为视频、图像、音频和文本构建模型与基础设施。网站展示了一系列模型,包括 Spark、Edge、Flash 和 Core,以及用于推理、视觉理解和训练数据生成的产品。
其公开产品体系围绕 Reka Vision 进行组织,用于视频和图像内容的搜索与推理;infer 用于多模态推理;Claru 用于构建训练数据。Reka Labs 还发布面向物理 AI 和边缘部署的研究与开源权重模型。
将图像和视频转化为结构化、可搜索的表示,并具备对象、动作、场景和事件识别,以及适用于长视频的时间分段功能。
支持对图像和视频进行自然语言搜索,包括跨帧和跨场景检索,以及长时段事件发现。
可从长视频中生成精彩片段、摘要和剪辑,并基于用户意图进行精彩内容检测,且使用语音识别生成字幕。
通过对跨时间的视觉内容进行推理来回答复杂问题,包括多步推理、基于时间的查询以及跨模态问题。
介绍了一个面向多模态 AI 的推理引擎和 API,专为速度、规模和企业级可靠性而构建。
提供开源权重的 Edge 模型和部署文档,包括本地使用和 API 访问,并附带模型卡、快速入门和集成示例。
按语义而非元数据搜索大型视频库,然后提取精彩片段、摘要或剪辑供审核或发布。
从摄像头画面中检测打斗、游荡、盗窃、交通事件及其他事件,然后为操作人员提供告警和摘要报告。
检查工厂车间中的安全问题或装配线异常,并基于摄像头分析生成结构化事件报告。
在边缘端运行用于机器人、车辆或可穿戴设备的多模态模型,以满足低延迟和离线运行需求。
基于第一人称视频、机器人轨迹、世界模型镜头和专家人工判断构建训练数据集,用于前沿 AI 工作流。
Reka Vision 旨在实现对大规模视频和图像内容的视觉理解与搜索。来源将其描述为一个可理解、搜索并推理视觉内容的多模态 AI 系统。
来源称 Reka Vision 支持视觉理解与索引、语义视频搜索、精彩片段和剪辑生成,以及视觉推理和问答。它还将对实时画面监控和告警作为平台定位的一部分。
Reka Labs 提供开源权重的 7B 视觉语言模型,并说明它们可以在本地运行或通过 API 使用。产品网站还提到 Edge 模型的部署示例,例如 HF 和 vLLM。
该网站将 Reka 定位为面向企业、创作者和开发者,适用于工业与制造、实体安全和智慧城市、媒体与娱乐、汽车与远程信息处理、扩展现实以及国防等场景。
定价页面未显示有效的价格信息,而是返回了未找到消息。联系页面则引导有兴趣的用户请求演示或通过电子邮件联系公司。
Crossing Minds 是一款检索平台,助力构建准确、安全、可扩展的 AI 应用。官网同时说明,公司团队将加入 OpenAI。
小艺是华为自主研发的 AI 智慧助手,支持知识问答、AI 写作、文档阅读、代码辅助与识图,适合日常查询、内容处理和鸿蒙开发场景,并支持文件拖放输入。
Orca 是面向编码代理的 Agent 开发环境,支持在隔离的 git worktree 中并行运行多个 CLI agent,并提供桌面端与移动端协作流程。
Firebase Studio 是一款基于浏览器的全栈应用开发工作区,支持 Gemini 辅助编写代码、应用预览、云模拟器、导入仓库、原型开发、协作与从浏览器部署。
EZsite AI 是一款 AI 网站构建器,可将 URL 转为完整的 React 或 Vue.js 应用。支持托管、自定义域名、代码导出及面向团队的后端功能,帮助快速交付可部署结果。
AI Magicx 是一体化 AI 工作区,集聊天、图片、视频、语音、音乐、邮件和开发任务于一处,帮助创作者、团队和开发者集中使用多种模型,无需在多个工具和订阅间切换。