Google发布TabFM:BigQuery内置零样本预测ML
DataHot 速览
Google Cloud宣布在BigQuery中推出TabFM模型,这是由Google Research开发的预训练基础模型,支持表格数据的回归与分类任务,通过SQL语句即可实现零样本预测。该模型利用上下文学习,免去传统训练、调参和部署流程,并可通过BigQuery MCP server为Agent应用添加预测能力。TabFM可处理数百万行数据,并在行业基准上优于开箱即用的传统定制模型。目前该功能处于预览阶段。
为什么值得关注:数据从业者可直接在BigQuery内用SQL完成预测任务,降低机器学习门槛,同时为Agent应用提供原生预测能力,值得关注。
本文目录 8 节
译文
AI 逐段翻译Vaibhav Sethi
集团产品经理
Xi Cheng
工程经理
立即试用 Gemini Enterprise
工作场所中 AI 的前门
历史上,企业预测分析任务(如预测流失、购买意图或欺诈评分)意味着使用 XGBoost、随机森林或深度神经网络(DNN)等库构建定制模型。虽然有效,但传统的训练-调整-部署-再训练循环可能复杂且耗时。此外,手动特征工程、超参数调整、冗长且昂贵的训练以及需要专业数据科学技能的开销,可能导致企业在决策中未充分利用预测模型。
今天,我们宣布 BigQuery 中的 TabFM 模型。由 Google Research 开发的 TabFM 是一个用于表格数据回归和分类的最先进的预训练基础模型。它利用上下文学习(ICL),通过单个 SQL 语句即时对您的表格数据集提供高度准确的预测,消除了单独的培训和部署步骤。BigQuery 上的 TabFM 目前处于预览阶段。
以下是 TabFM 为您的 BigQuery 分析带来的功能:
- 零样本预测:跳过模型训练、调整和工件部署。只需将标记的历史数据和新预测表传递给单个 SQL 函数,即可获得即时、高质量的预测。
- 为您的代理应用提供预测性机器学习:正在为您的业务用例构建代理?通过 TabFM 加上 BigQuery MCP 服务器 为它添加预测能力。无需管理运行时或基础设施,只需输入数据并输出预测。
- 最先进的准确性:在复杂数据集上优于自定义训练的、开箱即用的传统模型,在行业基准测试中实现卓越的准确性得分。
- 简单的开发者体验:在 BigQuery 中原生运行,可通过简单的 SQL 语法访问。自动处理特征化任务,如缺失值、分类编码等,无需管理复杂的特征工程管道。
- 可扩展性: 使用 BigQuery 的分布式推理架构,在几分钟内处理大型推理表(高达数百万行)。
表格预测的领先模型
Google 的 TabFM 在广泛的表格数据上提供行业领先的准确性。在 TabArena 基准测试的评估中,TabFM 始终优于经典机器学习模型和其他表格基础模型。
TabArena 分类(上)和回归(下)中前 10 名模型的 ELO 评分(↑)。(D)= 默认;(T+E)= 调整 + 集成。较高的分数表示更优的性能。
了解有关 TabFM 模型的更多信息 此处。
在 BigQuery 中开始使用 TabFM
使用 TabFM 很简单。它直接通过新的内置 SQL 函数公开:AI.PREDICT 和 AI.EVALUATE。
1. 使用 AI.PREDICT 获得即时预测 要进行预测,您只需编写一个传递训练数据和预测数据的查询。模型会根据目标标签的数据类型自动推断任务是分类问题还是回归问题。
正在加载...
在此示例中,输出包含预测表中的所有原始列,以及预测的标签和概率列(例如 predicted_is_fraud)。无需手动特征工程或模型创建。
2. 使用 AI.EVALUATE 评估模型 您可以使用 AI.EVALUATE 函数快速检查预测性能与测试集的对比。这允许您在一个步骤中生成标准评估指标。
正在加载...
AI.EVALUATE 返回一组强大的指标,如回归问题的 r2_score、mean_absolute_error 等,以及分类问题的精度、召回率和 F1 等指标。
BigQuery 中的 TabFM 的工作原理
传统机器学习需要将模型参数拟合到训练数据集。相比之下,TabFM 使用上下文学习。类似于大型语言模型(LLM)从提示中的少量示例学习任务,TabFM 将您的训练表作为上下文示例读取,并在单次前向传递中为目标表生成预测。
为了处理表格基础模型的计算复杂性和内存占用,BigQuery 对您的数据执行分布式、并行化推理。此外,为了优化性能和资源利用,它使用智能训练数据采样以及分布式执行。这使 BigQuery 能够处理大型输入行的训练数据,同时跨数百万行推理数据快速高效地执行预测。
选择合适的工具完成工作
TabFM 为 BigQuery 引入了突破性的零样本功能,并补充了现有的产品,如 XGBoost 模型。以下是如何在 TabFM 和其他模型之间进行选择:
- 当您需要快速、高质量的预测洞察而无需机器学习专业知识时,当历史数据集为中小型时,当数据频繁变化时,以及当您需要经常重新训练模型以保持准确性时,请使用 TabFM。它也非常适合需要按需预测分析的对话或代理工作流。
- 当您拥有非常大的历史数据集、需要对自定义超参数调整进行完全控制、特征数量超过 TabFM 当前限制,或需要特征重要性可解释性(即哪些输入特征对预测贡献最大)时,请使用 XGBoost 等传统模型。
预测性机器学习变得简单
借助原生集成到 BigQuery 的 TabFM,预测性机器学习现在就像运行标准 SELECT 查询一样简单。通过消除模型训练、调整和管理的手动开销,TabFM 让开发人员、数据科学家和分析师能够在几秒钟内从原始数据获得丰富的预测洞察。
要立即开始,请查看 公共文档。如有问题或反馈,请联系我们的团队:[email protected]。我们期待看到您的创作!
发布于
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏