定位:专做难例的专家数据开发
官网的标题是「面向前沿 AI 的专家数据开发」,并给出另一句更直白的表述:「我们打造推动前沿前进的数据」。它对行业痛点的判断写得很清楚:多数数据管线是为「量」而建,不是为「难」而建;前沿模型往往栽在专业领域的分布差异、基准盲区,以及那些连「什么算对」都难以定义的任务上。Snorkel 表示自己专门解决这类问题,并强调团队源自斯坦福 AI 实验室、在这一方向上已经做了近十年。
深度介绍
官网的标题是「面向前沿 AI 的专家数据开发」,并给出另一句更直白的表述:「我们打造推动前沿前进的数据」。它对行业痛点的判断写得很清楚:多数数据管线是为「量」而建,不是为「难」而建;前沿模型往往栽在专业领域的分布差异、基准盲区,以及那些连「什么算对」都难以定义的任务上。Snorkel 表示自己专门解决这类问题,并强调团队源自斯坦福 AI 实验室、在这一方向上已经做了近十年。
官方把能力分为三块:Snorkel Data Series 是课程化数据集,面向前沿模型最吃力的任务领域,内置评分细则、评审指引、难度分层与评测切片;定制数据开发面向现成数据覆盖不到的地方,按你需要的失败面构建专属数据集、评测与基准扩展;专用智能体则是基于专门数据构建、并在真实流程中以通过/失败标准评估的定制智能体,官方称其评估口径与能带来回报的性能标准绑定。三者构成从数据到落地的链条。
官网列出的数据类型分四类:专家演示与推理(人工解题轨迹、推理轨迹、专家问答理由、工作流与决策演示、工具调用演示)、偏好标签与排序(补丁、草稿与报告的质量排序、轨迹质检、风险与安全风格校准、有用与无害排序)、评分细则与可验证结果(单元测试与编译、确定性评分器、引用正确性、数值一致性),以及长时任务与环境(标准与自定义环境、代码库与命令行工具、浏览器图形界面测试台、多步有状态流程、模拟环境,并可接入你自己的工具、代码库、语料与权限)。
官方明确提出「多数数据质量问题其实是设计问题」:任务定义含糊会导致标注不一致,评审未经校准会引入系统性偏差,缺少来源记录会让故障分析变成猜测。它的流程包含五步:任务定义先行,把规格当作研究产物,写明目标分布、验收标准与验证器;校准式专家评审,评审者对照由研究人员撰写的金标集打分,并逐任务重新校准;评分细则与程序化检查,把细则蒸馏成程序化评分器与专用评估模型;裁决与溯源,形成作者、多评审与终审的流水线并保留审计记录;边缘覆盖,用专家种子通过模板化扩增覆盖难度带与失败模式。
平台对外发布并维护多个基准:Terminal-Bench Science 评估科研工作流上的智能体、Senior SWE-bench 评估编码智能体在真实「资深工程任务」上的表现、Agents' Last Exam 评估智能体完成有经济价值现实工作的能力、OSWorld 2.0 面向计算机操作智能体的长时桌面流程、Terminal-Bench 4.0 面向终端智能体,以及与法律 AI 团队合作的 BigLaw Bench。这些基准覆盖了当前智能体评测最受关注的几个方向,官方同时公开排行榜供横向比较。
官网的研究板块给出若干结论性内容,例如在低数据与低算力条件下的强化学习可验证奖励研究中,官方称「更好的数据胜过更多算力」;另有 RIFT 评分细则失效分类框架,用来诊断评测细则本身何时失效;还有面向保险承保场景的智能体基准,强调在真正高风险的领域里做「环境优先」的评测。这些结论对使用者的意义是:与其只增加训练规模,不如先把评测与数据的定义做扎实——这也是它整套方法论的前提。
官网设有专家社区入口,口号是「获得报酬,参与塑造更安全、更聪明的 AI」,意味着领域专家可以参与数据创作并取得收入,这是其专家数据供给的组织方式。研究侧另有开放基准资助计划,为开源 AI 研究提供资金支持,并公开与高校、云厂商等机构的合作信息。对希望进入该领域的研究者,这两条通道提供了参与方式;对企业用户,专家网络的规模与行业覆盖往往是评估交付能力的关键指标。
官网没有公布价格档位,也没有公开的自助注册入口,采购路径以「联系我们」与「申请数据集样本」为主,说明交付形态偏向项目制而非订阅制。这类模式适合数据需求明确、有专门预算的团队,但周期与成本取决于任务定义与专家资源排期,通常需要先做一轮范围界定。官方另设有安全页面说明数据保护方式,涉及敏感行业数据时建议在需求阶段就把驻留、权限与审计要求写进合同。
产品特点
官方明确不做追求体量的通用数据管线,而是针对专业领域的分布差异、基准盲区,以及那些连「什么算对」都难以定义的任务来构建数据集与评测。
流程要求先写清目标分布、验收标准与验证器定义,再把评分细则蒸馏成程序化评分器与专用评估模型,并用研究人员撰写的金标集校准评审者,以减少系统性偏差。
除标注数据外还提供标准与自定义环境、代码库与命令行工具、浏览器图形界面测试台与多步有状态流程,并可接入客户自己的工具、语料与权限。
覆盖科研(Terminal-Bench Science)、编码(Senior SWE-bench)、终端(Terminal-Bench 4.0)、计算机操作(OSWorld 2.0)、经济价值任务(Agents' Last Exam)与法律(BigLaw Bench)等方向,并公开排行榜。
最近动态
官网当前展示的合作基准包括 Terminal-Bench Science、Senior SWE-bench、Agents' Last Exam、OSWorld 2.0、Terminal-Bench 4.0 与 Harvey BigLaw Bench,其中 Terminal-Bench 4.0 被标为终端智能体的新基准,Senior SWE-bench 标注为「刚刚发布」。
官网把能力分为课程化数据集 Snorkel Data Series、定制数据开发与专用智能体三块;数据集内置评分细则、评审指引、难度分层与评测切片,专用智能体则按通过/失败标准在真实流程中评估。采购以联系销售与申请样本为主。
官方公开的流程包含任务定义先行、校准式专家评审、评分细则与程序化检查、裁决与溯源、边缘覆盖五步,并强调多数数据质量问题源于设计问题,规模并不等同于质量。
研究板块给出的结论包括在低数据与低算力条件下的可验证奖励研究中「更好的数据胜过更多算力」,以及 RIFT 评分细则失效分类框架与保险承保场景的智能体基准;官网同时开放专家社区与开放基准研究资助计划。
Snorkel AI 是一家做专家级训练数据的公司,官网的标题是「面向前沿 AI 的专家数据开发」,另一句表述是「我们打造推动前沿前进的数据」。它对行业痛点的判断是:多数数据管线为规模而建,而不是为难度而建,前沿模型往往栽在专业领域的分布差异、基准盲区与难以定义正确性的任务上,而它专做这类问题;团队源自斯坦福 AI 实验室,已在这一方向投入近十年。业务分为三条线:Snorkel Data Series 提供内置评分细则、评审指引、难度分层与评测切片的课程化数据集;定制数据开发按客户需要的失败面构建专属数据集、评测与基准扩展;专用智能体则基于专门数据构建,并在真实流程中以通过/失败标准评估。 数据类型覆盖四类:专家演示与推理(解题轨迹、推理轨迹、专家问答理由、工作流与工具调用演示)、偏好标签与排序(补丁与报告的质量排序、轨迹质检、风险与安全风格校准)、评分细则与可验证结果(单元测试与编译、确定性评分器、引用正确性、数值一致性),以及长时任务与环境(标准与自定义环境、代码库与命令行工具、浏览器图形界面测试台、多步有状态流程与模拟环境,并可接入客户自己的工具、语料与权限)。官方强调「多数数据质量问题其实是设计问题」,其流程包含任务定义先行、校准式专家评审、评分细则与程序化检查、裁决与溯源、边缘覆盖五步,其中规格被视为研究产物,评审者需对照金标集并逐任务重新校准。 评测方面,平台对外发布并维护多个基准:Terminal-Bench Science(科研工作流)、Senior SWE-bench(资深工程任务)、Agents' Last Exam(有经济价值的现实工作)、OSWorld 2.0(计算机操作长时流程)、Terminal-Bench 4.0(终端智能体)以及与法律 AI 团队合作的 BigLaw Bench,并公开排行榜。研究板块给出的结论包括在低数据与低算力条件下「更好的数据胜过更多算力」、RIFT 评分细则失效分类框架,以及保险承保场景的智能体基准。 获取方式上,官网没有公布价格档位,也没有自助注册入口,采购以联系销售与申请数据集样本为主,属于项目制交付;官方另设专家社区(专家参与数据创作并获得报酬)与开放基准研究资助计划。使用前建议注意三点:项目制交付的成本与周期取决于任务定义与专家排期,应先做范围界定;涉及敏感行业数据时应在需求阶段明确驻留、权限与审计要求;基准成绩会随版本与任务集更新而变化,横向对比时应确认所用版本与评测口径。
核验信息
本页事实来自 Snorkel AI 官方渠道:官网首页(「面向前沿 AI 的专家数据开发」定位、对数据管线痛点的判断、三条产品线概述、数据类型清单、研究方法论摘要、基准与合作方列表、专家社区与开放研究资助入口)、数据开发能力页(任务定义先行、校准式专家评审、评分细则与程序化检查、裁决与溯源、边缘覆盖五步流程)、工作方式页、专用智能体页、基准与排行榜页、研究与论文页(含低数据低算力条件下的研究结论、RIFT 评分细则失效分类、保险承保智能体基准)以及官方博客。价格未公开披露,以联系销售的项目报价为准;信息核验于 2026 年 9 月 22 日。
Snorkel AI介绍页面对您是否有帮助?