Redpoint Identity Studio:可解释的Snowflake原生身份解析
DataHot 速览
Redpoint Identity Studio 是一款 Snowflake 原生应用,可在用户自有环境中完成客户身份解析,让数据工程团队完全掌控匹配逻辑并查看每一次合并决策。它面向需要可信身份数据的场景,如喂给 AI Agent、下游模型、分析或营销客户体验,只需几步即可从原始客户数据得到精确匹配的身份。文章指出当前方案的两难:厂商托管工具快速但黑箱且数据外流,自建 SQL 流水线可控但维护成本高、逻辑随人员流失而失传。
为什么值得关注:身份解析是数据平台与语义层建设的关键环节,本文展示了在 Snowflake 内可解释、可控的身份匹配方案,对做数据集成治理和 AI Agent 数据供给的团队有参考价值。
本文目录 7 节
译文
AI 逐段翻译
Redpoint Identity Studio 是一款 Snowflake 原生应用程序,可在您自己的环境中解析客户身份,让您完全掌控匹配逻辑,并洞悉每一个决策。
只需点击几下,数据工程团队即可从原始客户数据获得精确匹配的身份。
为构建者而设计
我们将 Redpoint Identity Studio 设计给需要可信解析身份的数据工程师,无论是用于供给 AI 代理、下游模型、分析,还是营销和客户体验职能。
如果您的团队在购买黑盒供应商工具和承担资源密集型的 DIY 管道及维护之间感到进退两难,Redpoint Identity Studio 是一个新选择,它为您提供真正拥有且可解释的企业级身份解析。
身份解析难题
Snowflake 为您提供了集中化的数据基础,但您的团队仍需确定如何最好地管理它,而身份解析正是这一差距伤害最大的地方。如今,团队试图通过两种方式弥补这一差距,但两种方式都有所不足。
大多数组织在身份解析光谱上都处于某种令人不适的位置。一端是供应商管理的工具,将您的客户记录与专有数据图谱进行匹配。它们部署快速,但不透明。您无法看到两条记录为何合并,无法调整逻辑,且所需数据可能离开您控制的环境。另一端是自定义构建的方法:SQL 模型和定制流程,为您提供完全控制,但会消耗有限的工程资源来解决一个永远无法完全解决的问题。
DIY 身份逻辑的隐藏成本
除了预期的维护工作(包括检查匹配以确保您的设置仍服务于您的用例)之外,还会出现更难预测的其他成本。当模式发生变化时,管道可能会中断。解释决策的底层逻辑——例如为何选择某个流程而非另一个——在人员离职时往往没有文档记录。测试规则变更通常意味着以巨大的成本和风险重新处理大型表。诊断下游模型为何开始漂移,往往追溯到在多次运行之间悄然发生变化、需要关注的身份键。
通常,数据工程师会选择更简单的路径,仅实现确定性/精确匹配,这能让您接近目标。但根据我们的经验,要实现最高的匹配率和质量,必须将确定性与启发式和概率规则相结合。
对于金融服务和医疗保健等受监管行业的数据团队而言,供应商路径会带来额外的阻碍:不透明的身份逻辑——无论是因为供应商的黑盒方法还是未记录的自定义工作——意味着当被质疑时您无法为匹配质量辩护,并且审计困难,需要解释决策。许多评估在比较功能之前就停滞了。但透明度问题、身份错误的风险(例如将两位不同的临床患者解析为同一人),以及无法对其进行故障排除,在这些组织中会带来更高的成本。
我们构建 Redpoint Identity Studio 就是为了一次性解决这三个问题。
什么是 Redpoint Identity Studio?
Redpoint Identity Studio 是一款 Snowflake 原生应用,它使用您 Snowflake 环境内受治理的自有计算资源来解析客户身份(个人和家庭)。它将内置的数据清理(包括姓名、电话和电子邮件规范化以及地址标准化)与启发式、确定性(精确)和概率(模糊/家庭)匹配、用于人工介入配置和匹配审查的完整 UI,以及结构化实验框架相结合,全部集成在一个可通过 Snowflake Marketplace 获取的受治理应用中。
匹配逻辑在您自己的计算资源上、在您现有的 Snowflake 安全控制下执行。结果是一组身份键,您所有的下游流程——从 AI 到分析等等——都可以放心地基于其构建。

Redpoint Identity Studio
它如何工作?
用户配置、运行和优化身份匹配所需的一切都可通过简洁的网页 UI 访问,无需自定义管道,但您也可以通过 UDF 利用 Redpoint 的 API,将 Identity Studio 匹配流程嵌入到您的数据管道中。
- 借助 Cortex AI 引导的映射,几分钟内完成设置: 引导式入门向导使用 Cortex AI 帮助映射您的数据,并引导您完成初始匹配配置。它简单快捷,让您能快速获得匹配的身份,无需大量自定义 编码或陡峭的学习曲线。
- 一键运行您的首次匹配: 开箱即用,您将从我们在多年为客户解析复杂身份中验证过的设置开始,获得一个稳定的基线,您可以根据需要随时间进行自定义。我们发现这些设置通常能让团队达到最终身份模型的 95% 以上。“生产”页面实时显示作业进度和结果,并带有“审查”选项卡来检查和更正单个匹配组。
- 在提交之前先实验: 调整您的设置,针对完整数据集测试规则集更改,并在推广任何内容之前将其与生产结果并排比较。通过调整匹配阈值或修改字段级严格度设置来创建新实验。实验针对您的完整数据集运行,结果与您当前的生产输出并排比较。审查差异,然后选择推广或丢弃。在您决定之前,不会触及生产环境。

- 审查匹配并在需要时覆盖:手动覆盖允许你手动将记录重新分配到匹配组,从而覆盖自动匹配引擎的决策。当匹配算法产生错误分组,而人工审核员能够识别并纠正时,这一点至关重要。当在下游环境中发现错误结果,并且你想修复特定记录时,它也很有用。你的覆盖将在后续持续生效,因此每当这些记录再次由 Identity Studio 处理时,它都会使用你的覆盖来相应调整结果。通过可视化拖放步骤即可轻松重新分配记录,你也可以使用选择工具。

你的团队可以在安装应用程序的同一会话中,基于你自己的数据查看匹配结果。
面向构建者的关键功能
- Snowflake 原生执行:所有匹配逻辑和输出都在你的 Snowflake 环境中运行,并处于你已治理的安全控制之下。
- 可配置匹配:结合启发式、确定性和概率匹配,让你明确控制精确度,从一对一精确匹配到家庭和关系关联。根据你的需求调整设置,使匹配更严格或更宽泛。
- 透明的匹配审查:通过直观的 UI 检查匹配组,准确查看哪些记录被分组在一起,并逐案覆盖结果。
- 内置实验:在将任何内容推广到生产环境之前,安全地针对你的完整数据集测试规则集更改。你将把身份调优转变为一个受治理的流程。
在哪里可以找到 Redpoint Identity Studio 免费试用版你现在可以在 Snowflake Marketplace 上找到 Redpoint Identity Studio。
展示其工作过程的身份解析最初发表于 Snowflake Builders Blog: Data Engineers, App Developers, AI, & Data Scienceon Medium,人们正在那里通过突出显示并回应这个故事来继续对话。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏