RL 环境和 agent
创建强化学习环境和 agent 任务,要求多步行为、规划、可落地性以及工具使用,而不是单轮回复。
Surge AI 为先进 AI 系统训练与评估提供数据、评测和 RL 环境产品,适合需要专家判断、多语言数据、多模态训练信号及更难被“刷分”的评测流程的团队。
Surge AI 为后训练和 agent 开发构建数据和评测产品。网站将其工作围绕一个核心原则展开:质量至上,提供的内容包括 RL 环境和 agent、rubrics 和 verifiers、RLHF 数据、监督式演示、人类评估、专家领域数据、国际化、多模态数据集以及现成可用的开箱即用数据。
其所述使命是借助人类智能的丰富性来推动 AGI。实际上,这意味着将顶尖人类专业知识与可扩展监督工具相结合,使模型不仅能从静态基准中学习,还能从演示、偏好、专家判断和真实任务环境中学习。
创建强化学习环境和 agent 任务,要求多步行为、规划、可落地性以及工具使用,而不是单轮回复。
设计用于评估的评分卡和专家 rubric,包括细微差别很重要、标准基准过于浅显的场景。
生成基于偏好的训练数据,用于强化学习中的人类反馈,捕捉细微的质量差异。
通过演示示例来引导模型掌握技能,例如使用电脑、浏览网页以及从示例中推理。
在自动化指标不足以衡量时,提供关于实用性、安全性、细腻度、机智和情感质量的人类评估。
为专家领域、国际化、多模态理解以及预构建的开箱即用场景生成专用数据集。
使用 Surge AI 创建真实的多步骤环境,用于 agent 训练,尤其适合模型需要规划、适应、使用工具并完成特定领域工作的场景。
当标准基准太容易被“刷分”或过于浅显、无法捕捉质量、安全性或正确性的细微差别时,使用基于 rubric 的评估。
使用 RLHF 和监督式演示来教会模型偏好的行为、基础技能和任务流程,可在强化学习之前或与之同时进行。
使用专家贡献者在医学、法律、数学、计算机科学及其他专业学科中生成或审核数据。
当任务涉及不同语言、文化背景、图像、音频、视频或混合格式推理时,使用多语言和多模态数据集。
Surge AI 为训练先进 AI 系统构建数据、评测和 RL 环境产品。其页面强调后训练相关工作,如 RL 环境和 agent、rubrics 和 verifiers、RLHF、SFT、人工评估、专家专业领域、国际化、多模态数据以及现成可用的数据集。
网站说明其工作覆盖 70 多种语言,语言学家会设计能反映各语言语法、习语和世界观的数据。它还强调在医学、法律、数学、计算机科学和人文学科等领域的专家贡献者。
研究页面展示了围绕专家 rubric、具身多模态推理、科学审阅、研究级数学、企业级 RL 环境以及多模态奖励评估的基准和合作研究。
所提供页面中未列出任何集成。不过,网站确实表示 Surge AI 与 OpenAI、Anthropic、Meta 和 Google 等公司合作。