指标平台、语义模型与口径治理——从 BI 配件到 Agent 的数据入口
近 7 天收录 11 个事件 · 每 6 小时更新
dbt Wizard是dbt Labs推出的对话式AI工具,基于dbt项目的血缘、编译状态、测试和语义定义工作,提供构建、重构、调查、迁移四种模式。它可作为免费CLI在不到一分钟内安装,兼容dbt Core与dbt Cloud。Fivetran合伙人销售工程师撰文,阐述其如何压缩业务语言到数据模型间的翻译循环,并给出五大合作伙伴实践理由。
本文提出语义层五级能力模型,从L0提示词语义到L4过程语义,并指出L1到L2是质变:语义从辅助模型猜测变为无需猜测的约束。作者引用Cube配对实验数据,仅提供schema时前沿模型准确率在45.5%-50.5%,补充4KB手写语义说明文档后升至67.7%-68.7%。文章通过三条分界线为语义层选型提供衡量标尺,帮助从业者识别方案真实上限。
本文针对Cortex Analyst和Agent项目中常见的响应慢、结果不正确问题,指出根源往往在于语义模型、编排指令和工具描述等基础设置未受重视。内容包括如何精简现有语义视图、使用Cortex Search解析真实取值、用验证查询锚定SQL,以及通过工具描述和Agent指令路由问题,从而提升服务准确性与速度。
爱分析发布《2026爱分析·中国本体平台市场洞察报告》,系统梳理中国市场的本体实践路径与能力演进方向。报告指出,中国市场尚未形成统一的本体定义,并归纳出知识工程、语义层、业务本体、可执行本体四条路径。报告认为,本体平台需要形成语义表达、业务计算、行动执行和持续治理的闭环,并参考Palantir作为能力参照。
数澜科技创始人甘云锋在接受爱分析访谈时表示,“拆中台”是个误会,AI兴起后数据中台窗口重新打开。他认为数据基座的核心目标是持续输出高质量数据集,本体与语义层是企业AI消除歧义、降低幻觉的关键。数澜从高峰期500人缩减至几十人后,如今定位为“数据+AI”公司,专注数据基座、行业模型和数据智能体,服务军工、央国企及大型民企客户。
MotherDuck推出Guides,把指标定义、表关系、历史迁移和业务例外等说明作为可查询、可版本化的上下文保存在数仓中。Agent在执行查询或构建数据任务时,可以按需发现并加载这些说明,减少仅凭schema猜测业务语义造成的错误。
Snowflake 发布 2026 年 7 月 9 日至 15 日的 10.24 版本说明,新增每用户配额(Preview)功能,可对 AI 功能如 Cortex Agents、Snowflake CoWork 和 CoCo 设置用户级消费上限。同时,语义视图物化(Public preview)上线,支持物化常用维度和指标以预聚合数据、提升查询性能。
文章提出一套鉴别真假Data Agent的审查清单:真正的企业级Data Agent需同时满足语义层、目标驱动、证据链与自愈、权限治理、反馈沉淀五项要求。判断基准是它不能只是“会写SQL的聊天框”,必须回答理解数据、安全访问、可验证结果、沉淀资产四个问题。作者直言市场上八成产品只是NL2SQL套聊天框,用半小时逐项验证即可识别套壳。
Fivetran产品布道师Charles Wang撰文指出,单一事实来源不仅来自数据集中化,还必须从数据中构建上下文。他结合Fivetran与dbt Labs的托管数据湖服务(MDLS),说明开放表格式、持续同步与元数据发布如何支撑统一架构。文章强调AI系统缺乏隐性知识,必须通过上下文工程让信息显式、结构化、可信且可检索。他将上下文工程分为四类需求,并首先提及语义与血缘。
dbt Labs 发文探讨企业 AI 部署从“为仪表盘建模数据”转向“为 Agent 建模上下文”。文章以自身为例,起初直接使用供应商 MCP 连接 Gong 等数据源,导致单次通话分析消耗高达 5 万 Token(约 0.25 美元),总数据量超 5 亿 Token。他们随后将原始数据摄入数仓并通过建模总结,以降低成本和掌控上下文层。
数据工程师尝试用编码智能体处理SQL时,确实能获得帮助:样板代码被削减,脚手架搭建更快。但一个更棘手的 frustration 是,智能体生成的代码看似正确——语法有效、符合惯例——却不适用于实际环境。它不知道哪些表是生产表、哪些 schema 受治理、RBAC 结构如何,导致产出仍需人工重塑。