返回
RSS Google Cloud Data Analytics Blog AI 逐段翻译 发布 2026-09-14 08:00 收录于 09-15

BigQuery新增六个增强分析TVF函数

DataHot 速览

Google Cloud BigQuery新增一套增强分析表值函数(TVF),用AI、机器学习和统计方法自动化洞察发现与模式解释。首批六个函数包括AI.KEY_DRIVERS、AI.CAUSAL_EFFECT、ML.CORRELATION、ML.DETECT_CHANGE_POINTS、ML.TREND、ML.SEASONALITY,分别用于归因、因果影响、相关性、变点、趋势和季节性。这些函数在数据所在位置运行,减少导出到外部工具,并输出结构化SQL,可作为AI Agent技能集成,支持自动化和对话式数据调查。

为什么值得关注:BigQuery把归因、因果、趋势、季节性等增强分析能力直接做进SQL层,数据团队可在仓内完成诊断并接入Agent工作流;关注平台AI化和分析自动化的人值得看。

本文目录 8 节
  1. 链接洞察的分步示例
  2. 步骤 1:检测变化点
  3. 步骤 2:关键驱动因素归因
  4. 步骤 3:因果效应
  5. 将增强分析连接到 Conversational Analytics
  6. 示例 1:芝加哥出租车行程
  7. 示例 2:爱荷华州酒类数据集
  8. 采取下一步

译文

AI 逐段翻译

BigQuery 现在提供了一套增强分析表值函数(TVF),旨在大规模自动化复杂的数据分析。增强分析结合了 AI、ML 和统计方法,以自动化洞察发现和模式解释。这些函数让你能够诊断指标为何发生变化,揭示数据中潜在的趋势和关系,甚至隔离业务决策的真实影响。

这些 TVF 直接在数据所在之处运行,这有助于加快分析速度,并减少将数据导出到外部工具的需求。此外,由于这些函数紧凑且产生结构化 SQL 输出,它们可以轻松集成为 AI 代理的技能,从而轻松实现自动化、对话式的数据调查工作流。

我们在 BigQuery 中引入了六个新的增强分析函数,每个函数都是为了解决特定的分析挑战而创建的:

TVF 函数 它帮助你发现什么 它回答的现实问题
AI.KEY_DRIVERS 识别两个时间段或组之间指标上升或下降背后的主要驱动因素。 为什么本季度收入相比上季度激增?
AI.CAUSAL_EFFECT 通过将观察到的结果与预期基线进行比较,量化某个行动或事件的影响。 收入增长中有多少来自我们的定价更新,而不是自然增长?
ML.CORRELATION 评估数值指标对之间关系的方向和强度。 用户会话时长增加是否与更高的客户终身价值相关?
ML.DETECT_CHANGE_POINTS 识别指标相对于周围模式发生变化的特定日期或区间。 在哪些时间段我们的平台延迟经历了持续的结构性变化?
ML.TREND 将潜在的增长或下降与短期波动或噪声分离。 过去一年我的收入的潜在趋势是什么,排除掉异常的峰值和低谷?
ML.SEASONALITY 发现在小时、天、周、月或季度之间可预测的重复周期。 一周中哪些天持续经历最高的服务器负载?

正如我们在下一节中所示,这些函数可以轻松地链接在一起。一个函数的输出,例如检测到的时间窗口,可以直接参数化下一个分析步骤。

链接洞察的分步示例

考虑一个指标发生变化的案例,你需要诊断根本原因并测量业务提升。

为了诊断,我们可以使用 Austin Bikeshare 样本数据集(bigquery-public-data.austin_bikeshare.bikeshare_trips)链接 ML.DETECT_CHANGE_POINTS、AI.KEY_DRIVERS 和 AI.CAUSAL_EFFECT。该数据集包含该市共享单车项目的历史出行量 and 人口统计数据。

步骤 1:检测变化点

ML.DETECT_CHANGE_POINTS 自动识别时间序列数据中统计显著的结构性变化或水平变化。虽然此示例展示了对单个聚合指标的分析,但此函数高度可扩展,能够跨数百万个单独的时间序列运行。

为了找到这些变化,我们在每日基线上运行以下查询:

加载中...

输出识别出公司历史中基线发生变化的确切时间区间:

如果我们查看原始每日会话计数,这与随时间发生的变化一致。我们在下面突出显示持续时间最长的两个变化点:

2018 年 2 月的变化与奥斯汀市议会通过“无桩出行试点计划”的日期一致,该计划旨在改造交通生态系统,将共享电动滑板车和自行车整合到公共交通中。

步骤 2:关键驱动因素归因

我们可以将直接找到的 2018 年 2 月切片输入 AI.KEY_DRIVERS,以确定推动激增的特定因素(即 bike_type、subscriber_type 等)。AI.KEY_DRIVERS 可以在几秒钟内扫描数百万行多维数据。

我们将兴趣组定义为变化发生后的时间切片,并将其与变化前的时间段作为参考组进行比较。

加载中...

AI.KEY_DRIVERS 隔离出贡献最大的维度值。每一行包含一个segment,它表示由特定维度值组合(例如 subscriber_type = 'UT Student' 和 bike_type = 'classic')识别出的数据切片。

分析显示,在参考时间窗口和兴趣时间窗口之间,总体出行次数增加了 +374.7%(+40,159 次出行)。这一巨大增长绝大多数集中在 U.T. Student Memberships(+7,167.1%)和终点为 21st & Speedway @PCL 站点的出行(+20,739.1%)。

这与 Austin Bikeshare 对无桩出行试点计划的响应一致。2 月初,该共享单车项目与德克萨斯大学启动了大型促销合作,为所有 UT 学生提供免费年度会员。

步骤 3:因果效应

虽然我们知道是什么推动了激增以及它何时开始,但我们需要隔离有机预期之上的真实投资回报。AI.CAUSAL_EFFECT 可以构建一个ARIMA_PLUS反事实,以衡量如果该计划从未启动,出行量本会是多少。

加载中...

如果我们绘制每日预测出行次数和实际出行次数的图表,我们可以看到相对于反事实的激增。

如果我们设置output_time_series => FALSE,我们可以查看提升的摘要

AI.CAUSAL_EFFECT 显示,该计划导致访问量相较自然基线预测激增 +358%,估计带来 89,775 次增量出行(因果效应概率为 99.9%)。

将增强分析连接到 Conversational Analytics

Conversational Analytics 让你使用自然语言与智能体就数据进行对话。所有新的 BigQuery 增强分析函数现已在 Conversational Analytics 中可用。由于这些 TVF 可以在数秒内以 BigQuery 规模执行复杂分析,Conversational Analytics 可以根据给定提示编排多步骤调查工作流。下面我们展示两个示例:

示例 1:芝加哥出租车行程

以下是一个使用芝加哥出租车行程(`bigquery-public-data.chicago_taxi_trips.taxi_trips`)的示例。

提示: 哪个指标与司机获得小费的相关性最强?然后运行归因分析,告诉我哪些分类维度(如地点和支付类型)最不成比例地驱动该特定指标。

此处的分析结果结合使用了 ML.CORRELATION 与 AI.KEY_DRIVERS。

信用卡支付是行程距离的主要正向驱动因素,由于更长的行驶路线和自动化数字小费跟踪,增加了 +1.65M。来自奥黑尔国际机场(社区区域 76)的行程是另一个主要正向因素,在有信用卡小费的行程中额外贡献了 +1.10M 英里。相比之下,现金交易是显著的负向驱动因素(-652.96K 英里),反映出人们主要使用现金进行较短行程,而非较长的机场出行。

示例 2:爱荷华州酒类数据集

以下是一个使用爱荷华州酒类数据集(`bigquery-public-data.iowa_liquor_sales.sales`)的示例,结合使用了 ML.TREND 与 ML.SEASONALITY。

提示: 查找所售瓶数的历史趋势。然后,描述年度季节性模式。

结果显示,爱荷华州的酒类销售呈现持续的长期增长,从 2012 年的 130 万至 150 万瓶上升,随后在近年来稳定在约 260 万瓶。存在强烈的季节性周期,尤其是在 10 月和 12 月以及 5 月和 6 月。1 月和 2 月前后销售出现下降。

这些 TVF 的技能现已在 Google Skills Github 代码库中提供。BQ AI/ML 技能可以在 此处 找到。

采取下一步

Conversational Analytics 中的 BigQuery AI/ML 支持

我们衷心感谢 Katelin Amann、Shirley Fu、Chaoyi Shen、Haiyang Qi、Zheng Zhang、Xi Cheng 以及更广泛工程团队对这项工作的反馈与贡献。

发布于

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存