AI产品库
Snorkel AI Logo

品牌档案

Snorkel AI

为前沿模型打造专家级训练数据

官方把自己定位为「面向前沿 AI 的专家数据开发」:帮助前沿实验室与 AI 团队构建研究级数据集、评测系统与可运行环境,并称其专注的是难度问题,而不是常规覆盖不足的问题。

深度介绍

Snorkel AI详细介绍

🧭

定位:专做难例的专家数据开发

官网的标题是「面向前沿 AI 的专家数据开发」,并给出另一句更直白的表述:「我们打造推动前沿前进的数据」。它对行业痛点的判断写得很清楚:多数数据管线是为「量」而建,不是为「难」而建;前沿模型往往栽在专业领域的分布差异、基准盲区,以及那些连「什么算对」都难以定义的任务上。Snorkel 表示自己专门解决这类问题,并强调团队源自斯坦福 AI 实验室、在这一方向上已经做了近十年。

🧱

三条产品线:数据、定制开发与专用智能体

官方把能力分为三块:Snorkel Data Series 是课程化数据集,面向前沿模型最吃力的任务领域,内置评分细则、评审指引、难度分层与评测切片;定制数据开发面向现成数据覆盖不到的地方,按你需要的失败面构建专属数据集、评测与基准扩展;专用智能体则是基于专门数据构建、并在真实流程中以通过/失败标准评估的定制智能体,官方称其评估口径与能带来回报的性能标准绑定。三者构成从数据到落地的链条。

🗂

数据覆盖面:从解题轨迹到可运行环境

官网列出的数据类型分四类:专家演示与推理(人工解题轨迹、推理轨迹、专家问答理由、工作流与决策演示、工具调用演示)、偏好标签与排序(补丁、草稿与报告的质量排序、轨迹质检、风险与安全风格校准、有用与无害排序)、评分细则与可验证结果(单元测试与编译、确定性评分器、引用正确性、数值一致性),以及长时任务与环境(标准与自定义环境、代码库与命令行工具、浏览器图形界面测试台、多步有状态流程、模拟环境,并可接入你自己的工具、代码库、语料与权限)。

⚙️

方法论:把数据质量当作设计问题

官方明确提出「多数数据质量问题其实是设计问题」:任务定义含糊会导致标注不一致,评审未经校准会引入系统性偏差,缺少来源记录会让故障分析变成猜测。它的流程包含五步:任务定义先行,把规格当作研究产物,写明目标分布、验收标准与验证器;校准式专家评审,评审者对照由研究人员撰写的金标集打分,并逐任务重新校准;评分细则与程序化检查,把细则蒸馏成程序化评分器与专用评估模型;裁决与溯源,形成作者、多评审与终审的流水线并保留审计记录;边缘覆盖,用专家种子通过模板化扩增覆盖难度带与失败模式。

📊

基准矩阵:从科研到法律与终端

平台对外发布并维护多个基准:Terminal-Bench Science 评估科研工作流上的智能体、Senior SWE-bench 评估编码智能体在真实「资深工程任务」上的表现、Agents' Last Exam 评估智能体完成有经济价值现实工作的能力、OSWorld 2.0 面向计算机操作智能体的长时桌面流程、Terminal-Bench 4.0 面向终端智能体,以及与法律 AI 团队合作的 BigLaw Bench。这些基准覆盖了当前智能体评测最受关注的几个方向,官方同时公开排行榜供横向比较。

🔬

研究结论:数据的作用被反复强调

官网的研究板块给出若干结论性内容,例如在低数据与低算力条件下的强化学习可验证奖励研究中,官方称「更好的数据胜过更多算力」;另有 RIFT 评分细则失效分类框架,用来诊断评测细则本身何时失效;还有面向保险承保场景的智能体基准,强调在真正高风险的领域里做「环境优先」的评测。这些结论对使用者的意义是:与其只增加训练规模,不如先把评测与数据的定义做扎实——这也是它整套方法论的前提。

🧑‍🏫

专家社区与开放研究资助

官网设有专家社区入口,口号是「获得报酬,参与塑造更安全、更聪明的 AI」,意味着领域专家可以参与数据创作并取得收入,这是其专家数据供给的组织方式。研究侧另有开放基准资助计划,为开源 AI 研究提供资金支持,并公开与高校、云厂商等机构的合作信息。对希望进入该领域的研究者,这两条通道提供了参与方式;对企业用户,专家网络的规模与行业覆盖往往是评估交付能力的关键指标。

💳

采购方式:按项目报价,无公开价目

官网没有公布价格档位,也没有公开的自助注册入口,采购路径以「联系我们」与「申请数据集样本」为主,说明交付形态偏向项目制而非订阅制。这类模式适合数据需求明确、有专门预算的团队,但周期与成本取决于任务定义与专家资源排期,通常需要先做一轮范围界定。官方另设有安全页面说明数据保护方式,涉及敏感行业数据时建议在需求阶段就把驻留、权限与审计要求写进合同。

产品特点

核心功能与独有价值

01

面向「难例」而非规模的数据开发

官方明确不做追求体量的通用数据管线,而是针对专业领域的分布差异、基准盲区,以及那些连「什么算对」都难以定义的任务来构建数据集与评测。

02

把规格与细则前置为研究产物

流程要求先写清目标分布、验收标准与验证器定义,再把评分细则蒸馏成程序化评分器与专用评估模型,并用研究人员撰写的金标集校准评审者,以减少系统性偏差。

03

数据与可运行环境一并交付

除标注数据外还提供标准与自定义环境、代码库与命令行工具、浏览器图形界面测试台与多步有状态流程,并可接入客户自己的工具、语料与权限。

04

自建并公开多个智能体基准

覆盖科研(Terminal-Bench Science)、编码(Senior SWE-bench)、终端(Terminal-Bench 4.0)、计算机操作(OSWorld 2.0)、经济价值任务(Agents' Last Exam)与法律(BigLaw Bench)等方向,并公开排行榜。

最近动态

重要更新

基准矩阵与新增基准(官网核验时点)

官网当前展示的合作基准包括 Terminal-Bench Science、Senior SWE-bench、Agents' Last Exam、OSWorld 2.0、Terminal-Bench 4.0 与 Harvey BigLaw Bench,其中 Terminal-Bench 4.0 被标为终端智能体的新基准,Senior SWE-bench 标注为「刚刚发布」。

三条产品线与交付形态(核验时点)

官网把能力分为课程化数据集 Snorkel Data Series、定制数据开发与专用智能体三块;数据集内置评分细则、评审指引、难度分层与评测切片,专用智能体则按通过/失败标准在真实流程中评估。采购以联系销售与申请样本为主。

数据开发方法论(核验时点)

官方公开的流程包含任务定义先行、校准式专家评审、评分细则与程序化检查、裁决与溯源、边缘覆盖五步,并强调多数数据质量问题源于设计问题,规模并不等同于质量。

研究结论与社区计划(核验时点)

研究板块给出的结论包括在低数据与低算力条件下的可验证奖励研究中「更好的数据胜过更多算力」,以及 RIFT 评分细则失效分类框架与保险承保场景的智能体基准;官网同时开放专家社区与开放基准研究资助计划。

产品总结

Snorkel AI 是一家做专家级训练数据的公司,官网的标题是「面向前沿 AI 的专家数据开发」,另一句表述是「我们打造推动前沿前进的数据」。它对行业痛点的判断是:多数数据管线为规模而建,而不是为难度而建,前沿模型往往栽在专业领域的分布差异、基准盲区与难以定义正确性的任务上,而它专做这类问题;团队源自斯坦福 AI 实验室,已在这一方向投入近十年。业务分为三条线:Snorkel Data Series 提供内置评分细则、评审指引、难度分层与评测切片的课程化数据集;定制数据开发按客户需要的失败面构建专属数据集、评测与基准扩展;专用智能体则基于专门数据构建,并在真实流程中以通过/失败标准评估。 数据类型覆盖四类:专家演示与推理(解题轨迹、推理轨迹、专家问答理由、工作流与工具调用演示)、偏好标签与排序(补丁与报告的质量排序、轨迹质检、风险与安全风格校准)、评分细则与可验证结果(单元测试与编译、确定性评分器、引用正确性、数值一致性),以及长时任务与环境(标准与自定义环境、代码库与命令行工具、浏览器图形界面测试台、多步有状态流程与模拟环境,并可接入客户自己的工具、语料与权限)。官方强调「多数数据质量问题其实是设计问题」,其流程包含任务定义先行、校准式专家评审、评分细则与程序化检查、裁决与溯源、边缘覆盖五步,其中规格被视为研究产物,评审者需对照金标集并逐任务重新校准。 评测方面,平台对外发布并维护多个基准:Terminal-Bench Science(科研工作流)、Senior SWE-bench(资深工程任务)、Agents' Last Exam(有经济价值的现实工作)、OSWorld 2.0(计算机操作长时流程)、Terminal-Bench 4.0(终端智能体)以及与法律 AI 团队合作的 BigLaw Bench,并公开排行榜。研究板块给出的结论包括在低数据与低算力条件下「更好的数据胜过更多算力」、RIFT 评分细则失效分类框架,以及保险承保场景的智能体基准。 获取方式上,官网没有公布价格档位,也没有自助注册入口,采购以联系销售与申请数据集样本为主,属于项目制交付;官方另设专家社区(专家参与数据创作并获得报酬)与开放基准研究资助计划。使用前建议注意三点:项目制交付的成本与周期取决于任务定义与专家排期,应先做范围界定;涉及敏感行业数据时应在需求阶段明确驻留、权限与审计要求;基准成绩会随版本与任务集更新而变化,横向对比时应确认所用版本与评测口径。

产品类型
训练数据开发与评测
支持平台
课程化数据集(Snorkel Data Seri / 定制数据与评测开发 / 专用智能体构建 / 可运行环境与评测框架 / 公开基准与排行榜 / 专家社区与标注网络
资费模式
官网未公布公开价目,采用联系销售的方式按项目报价;另设专家社区,专家可参与数据创作并获得报酬。

核验信息

参考文章与数据来源

本页事实来自 Snorkel AI 官方渠道:官网首页(「面向前沿 AI 的专家数据开发」定位、对数据管线痛点的判断、三条产品线概述、数据类型清单、研究方法论摘要、基准与合作方列表、专家社区与开放研究资助入口)、数据开发能力页(任务定义先行、校准式专家评审、评分细则与程序化检查、裁决与溯源、边缘覆盖五步流程)、工作方式页、专用智能体页、基准与排行榜页、研究与论文页(含低数据低算力条件下的研究结论、RIFT 评分细则失效分类、保险承保智能体基准)以及官方博客。价格未公开披露,以联系销售的项目报价为准;信息核验于 2026 年 9 月 22 日。

  1. 官网Snorkel AI 官网
  2. 其他数据开发能力
  3. 其他工作方式
  4. 其他专用智能体
  5. 其他基准与排行榜
  6. 其他研究与论文
  7. 其他官方博客
  8. 其他官方 GitHub 组织

用户体验调查

Snorkel AI介绍页面对您是否有帮助?