{"schema_version":1,"generated_at":"2026-09-30T06:19:55.706919+08:00","site_url":"https://datahot.xiahongbin.com","push_policy":{"version":"important-v1","recommended_poll_seconds":900,"max_age_hours":48,"max_per_run":3,"max_per_day":5,"rules":["pinned","importance>=80","importance>=75 and source_count>=2"]},"events":[{"event_id":"60bf8e4b7542","title":"Snowflake交互式数仓上的一体化AI应用与可观测性","summary":"作者在单个 Snowflake Interactive Warehouse 上同时构建零售运营 AI 应用和其可观测性管线。Cortex Agents 基于 Semantic View 生成 Text-to-SQL，查询约 2500 万行销售数据；AI Observability 自动将 trace、span、工具调用和 token 数写入 SNOWFLAKE.LOCAL.AI_OBSERVABILITY_EVENTS，无需 SDK 或 collector。监控看板与 Agent 共用同一仓库，最终发现了一个被 Agent 100% 成功率掩盖的语义视图缺陷。完整 SQL、代码和 Streamlit 应用已发布在 GitHub。","why_it_matters":"对想落地 Data Agent 并解决其可观测性、语义一致性与评估问题的数据团队有直接参考价值；也展示了 Snowflake 交互式数仓、Cortex Agents 与 AI Observability 的一体化实践。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent","语义层"],"vendors":["Snowflake"],"importance":91,"heat":72,"pinned":false,"published_at":"2026-09-29T22:01:07+08:00","discovered_at":"2026-09-30T06:19:55.706919+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/60bf8e4b7542.html"}},{"event_id":"80b6ab9f4ca1","title":"为 Amazon MWAA 构建 LLM 驱动的 DAG 故障分析插件","summary":"Apache Airflow 已成为数据管道编排核心，但当管道扩展到数百个 DAG 并跨 AWS Glue、Amazon EMR、Amazon Athena、Amazon Redshift 等服务时，单个任务失败排查非常耗时。本文介绍如何构建自定义 Airflow 插件，集成 Amazon Bedrock（Anthropic Claude）自动分析 DAG 任务失败，并给出可操作的诊断洞察。插件部署在 Amazon MWAA 上，在 Airflow UI 中提供按需 AI 根因分析。完整源码已发布在 GitHub 示例仓库中。","why_it_matters":"数据从业者可了解如何用 LLM 增强数据管道可观测性与故障排查，降低 SLA 风险与数据工程运维负担。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["AWS","Amazon MWAA","Amazon Bedrock"],"importance":82,"heat":69,"pinned":false,"published_at":"2026-09-30T00:17:09+08:00","discovered_at":"2026-09-30T06:19:55.706919+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/80b6ab9f4ca1.html"}},{"event_id":"3a80433f12dc","title":"Aurora PostgreSQL 与 SageMaker zero-ETL 集成","summary":"AWS 推出 Amazon Aurora PostgreSQL 与 Amazon SageMaker 的 zero-ETL 集成，将 Aurora PostgreSQL 数据近实时复制到 AWS Glue Data Catalog，并以 Apache Iceberg 表形式提供分析访问。该集成基于 CDC，通过增强逻辑复制捕获事务日志中的插入、更新和删除，减少传统 ETL 管道的延迟、运维开销与数据孤岛。用户可在 SageMaker 中结合 S3 数据湖和 Redshift 数仓的数据，用 SQL、Spark、BI 及 AI/ML 工具分析同一份数据。文章还介绍了 Lake Formation 的统一访问控制、湖仓架构和配置查询流程。","why_it_matters":"数据从业者可了解 AWS 在湖仓与零 ETL 方向的产品化路径，以及基于 CDC/逻辑复制的近实时数据接入机制，对评估数据集成架构和治理有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓","实时分析"],"vendors":["AWS","Amazon Aurora","Amazon SageMaker","AWS Glue","Amazon Redshift"],"importance":74,"heat":65,"pinned":false,"published_at":"2026-09-30T00:10:14+08:00","discovered_at":"2026-09-30T06:19:55.706919+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/3a80433f12dc.html"}},{"event_id":"08a45c43e18e","title":"Google Data Cloud 更新：Pub/Sub AI推理、Kafka连接器与Dataflow","summary":"Google Cloud 博客汇总了 9 月 7 日至 10 日的 Data Cloud 更新。Pub/Sub SMT 现可对 Gemini Enterprise Agent Platform 托管模型进行 AI 推理，预测结果会追加到事件中，供 BigQuery 或 BigTable 等下游处理，该功能已 GA。Managed Service for Apache Kafka 的 PostgreSQL Source Connector 已 GA，可低延迟捕获 Cloud SQL for Postgres、AlloyDB 和自管 PostgreSQL 的变更。Dataflow 批处理任务 pause-on-failure 已 GA，可在失败前保留状态；BigQuery insertAll API 更名为 Storage Write API（REST），零代码变更并 100% 向后兼容。","why_it_matters":"这些更新直接影响流式数据接入、事件推理、CDC 同步、作业可靠性和 BigQuery 写入方式，是数据平台架构与数据集成治理从业者需要关注的官方产品变化。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","实时分析"],"vendors":["Google","Google Cloud","BigQuery","Pub/Sub","Dataflow"],"importance":66,"heat":30,"pinned":false,"published_at":"2026-09-10T08:00:00+08:00","discovered_at":"2026-09-30T06:19:55.706919+08:00","sources":{"count":1,"names":["Google Cloud Data Analytics Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/08a45c43e18e.html"}},{"event_id":"636a535a2d03","title":"AWS 在 Amazon EMR on EKS 上支持 Spark Connect","summary":"AWS 宣布在 Amazon EMR on EKS 上支持 Spark Connect，起始版本为 EMR 7.14（Apache Spark 3.5.8）与 emr-spark-8.1（Apache Spark 4.1.1）。开发者可在 VS Code、PyCharm、Jupyter、SageMaker Unified Studio 等本地工具中构建、测试和调试 PySpark 应用，实际计算则路由到 EKS 上的 Spark 集群执行。该能力基于客户端-服务端架构，通过 gRPC/TLS 连接，旨在解决本地环境与远程集群之间的依赖冲突和规模性能差异。每个 Spark Connect 会话可使用独立的 IAM 执行角色与自定义标签，便于权限隔离和成本追踪，AWS 还提供了端到端示例 notebook。","why_it_matters":"Spark Connect 把交互式开发与 EKS 上弹性 Spark 计算解耦，是数据平台在湖仓处理与开发体验上的基础设施级变化，影响 CI/CD 数据质量测试、Notebook 交互开发等工程实践。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["AWS","Amazon EMR","Amazon EKS","Amazon SageMaker"],"importance":60,"heat":59,"pinned":false,"published_at":"2026-09-30T00:12:17+08:00","discovered_at":"2026-09-30T06:19:55.706919+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/636a535a2d03.html"}},{"event_id":"a5ce3472770d","title":"Apache Iceberg C++ 0.4.0 发布","summary":"Apache Iceberg 社区宣布 Apache Iceberg C++ 0.4.0 发布。该版本包含来自 26 位贡献者的 160 多个 PR，其中 12 位为首次贡献者。iceberg-cpp 是 Apache Iceberg 表格式的原生 C++ 实现，提供在 C++ 应用中读取、写入和管理 Iceberg 表的库。","why_it_matters":"Iceberg 是湖仓表格式关键基础设施，C++ 原生实现更新对需要在 C++ 生态中读写 Iceberg 表的数据平台与引擎团队有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["Apache Iceberg"],"importance":56,"heat":34,"pinned":false,"published_at":"2026-09-26T08:00:00+08:00","discovered_at":"2026-09-30T06:19:55.706919+08:00","sources":{"count":1,"names":["Apache Iceberg Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/a5ce3472770d.html"}},{"event_id":"6fa801a59b33","title":"Jev与DuckDB：在SQL中用自然语言条件","summary":"TypeSafe AI于2026年9月15日发布Jev模型，它返回带概率的类型化答案而非文本段落，支持是/否、选项和评分三类问题。发布一周内，社区为DuckDB开发了扩展，可用自然语言条件对CSV、Parquet或表进行过滤、分类和打分，约1000行数据耗时约10秒。Jev报告端到端延迟70-500毫秒，输入token价格0.042美元/百万。文章介绍了Jev的机制、DuckDB扩展的工作方式及相关讨论。","why_it_matters":"把LLM式语义判断以类型化、可SQL集成的形式落地到DuckDB分析流程，为数据从业者提供了在数仓内做文本分类和过滤的新路径，并涉及成本、延迟与准确性的工程权衡。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","ChatBI"],"vendors":["DuckDB","TypeSafe AI"],"importance":74,"heat":59,"pinned":false,"published_at":"2026-09-29T08:00:00+08:00","discovered_at":"2026-09-29T20:55:46.210612+08:00","sources":{"count":1,"names":["DuckDB Engineering Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/6fa801a59b33.html"}},{"event_id":"d93a22e74285","title":"ClickHouse Fabric 工作负载公测：OneLake 亚秒级分析","summary":"ClickHouse Workload for Microsoft Fabric 现已公开预览，可从 Fabric 工作负载中心获取，把 ClickHouse 作为 OneLake 的加速层。用户可将 OneLake 表同步到专属 ClickHouse Cloud 服务，在 Fabric 内以亚秒级响应查询数十亿行，且 OneLake 保持唯一事实源。该工作负载使用 Microsoft Entra 账户在 Azure 上开通专属 ClickHouse Cloud 计算，含试用，可服务 AI agent、仪表盘和应用而不消耗 Fabric 容量。它还提供内嵌 SQL 控制台、Power BI 认证连接器、Fabric notebook 及面向 Copilot Studio/GitHub Copilot 的只读治理访问。","why_it_matters":"数据从业者可关注 OneLake 上亚秒级、高并发查询能力，以及 Fabric 内引入 ClickHouse 加速 AI agent 与看板负载、避免自建缓存和 ETL 的方案。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓","实时分析"],"vendors":["ClickHouse","Microsoft Fabric","Power BI"],"importance":60,"heat":63,"pinned":false,"published_at":"2026-09-29T15:18:14+08:00","discovered_at":"2026-09-29T20:55:46.210612+08:00","sources":{"count":1,"names":["ClickHouse Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/d93a22e74285.html"}},{"event_id":"3bdb33764a67","title":"Google Earth Engine 推出 AI 助手 Ask辅助地理空间编程","summary":"Google Earth Engine 在其 Code Editor 中推出 Ask 面板，直接集成 Gemini 能力。用户可使用自己的 Gemini API key，在编辑器内编写、调试、理解和优化地理空间查询。Ask 会自动结合当前脚本、导入的资产与几何数据以及会话历史等上下文，并支持查看 diff 后合并进脚本。启动时可选 Gemini 3 Flash Preview、Gemini 3.1 Pro Preview 和 Gemini 3.5 Flash 等模型。","why_it_matters":"该功能展示了地理空间数据平台如何把上下文感知的 AI 助手嵌入开发工作流，提升查询编写与调试效率；对关注平台 AI 化和 Data Agent 落地的数据从业者有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Google","Google Cloud","Google Earth Engine","Gemini"],"importance":57,"heat":44,"pinned":false,"published_at":"2026-09-28T08:00:00+08:00","discovered_at":"2026-09-29T13:47:09.829788+08:00","sources":{"count":1,"names":["Google Cloud Data Analytics Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/3bdb33764a67.html"}},{"event_id":"36733bd85f86","title":"SageMaker Unified Studio 支持 IAM 权限边界","summary":"Amazon SageMaker Unified Studio 现在支持为 Tooling blueprint 创建的 IAM 角色配置自定义 permissions boundary。使用 SCP 要求所有 IAM 角色必须带权限边界的受监管组织，无需改变安全策略即可采用该服务。文章演示如何创建限制 AI agent 能力的 permissions boundary，并通过 AWS CLI 将其配置到 Tooling blueprint，最后验证已预置角色是否都受边界约束。此前若 SCP 强制要求权限边界，项目创建会因 iam:CreateRole 被显式拒绝而失败。","why_it_matters":"受监管企业的数据平台团队常通过 SCP 强制 IAM 角色权限边界；该能力影响 SageMaker Unified Studio 在数据工程、ML 与分析项目中的合规落地与角色权限治理。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["AWS","Amazon SageMaker"],"importance":87,"heat":62,"pinned":false,"published_at":"2026-09-28T23:45:42+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/36733bd85f86.html"}},{"event_id":"e4034125cc97","title":"Databricks 如何让1.4万员工首日接入前沿模型","summary":"Databricks 官方博客介绍其让上万名员工在新模型发布首日即可试用前沿模型的机制，核心依托 Unity Gateway 进行自适应发布、评估与成本控制。文中披露：被宣传为前沿的模型未必更好，如 Opus 5.0 成本更高且工程师质量评分低于 Opus 4.8。无成本约束地开放 GPT Astra 时，开发者平均支出增加 60%，因此采用按用户预算限制与用量引导。在 Opus 5、GPT-6 Sol 与 GPT-Luna 密集发布的当周，Databricks 全员首日接入，第 3 天即用数据确认其处于效率前沿并纳入基础设施。","why_it_matters":"这是一份难得的超大规模企业内部 AI 模型接入与治理第一手实践，涉及模型评估、成本控制与灰度发布，对正在建设模型网关与 AI 平台治理的数据团队有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Databricks"],"importance":85,"heat":66,"pinned":false,"published_at":"2026-09-29T04:11:23+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/e4034125cc97.html"}},{"event_id":"23c94827e91f","title":"Lakebase Search：为 Postgres 带来全文与向量搜索","summary":"Lakebase 为 Postgres 推出 Lakebase Search，包含 lakebase_vector（可扩展近似邻居搜索）和 lakebase_text（BM25 全文搜索）两个扩展，现已在 AWS 和 Azure 正式可用。官方称在 VectorDBBench 100M 基准上，lakebase_vector 吞吐量达到次优系统的 2 倍，成本仅为使用 pgvector 的云 Postgres 厂商的 1/4。其测试显示在 100M LAION 数据集上，97% recall 时 P99 延迟为 71 毫秒。客户 Conexiom 使用 BM25 混合搜索处理超 1 亿行数据，计算资源仅为此前 pgvector 方案的一半。","why_it_matters":"Lakebase 把向量与 BM25 全文搜索直接放进 Postgres，瞄准 AI Agent 的低延迟、高准确检索需求，并给出吞吐、成本、延迟与召回率数据。数据平台从业者可据此评估是否仍需外挂独立搜索/向量数据库，以及 pgvector 在规模化后的替代路径。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["Data Agent"],"vendors":["Databricks","Lakebase"],"importance":85,"heat":62,"pinned":false,"published_at":"2026-09-29T04:04:33+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/23c94827e91f.html"}},{"event_id":"871c27bf0387","title":"Snowflake AI 账单的三层成本控制：多数团队只建了一层","summary":"文章讨论 Snowflake 上 AI 支出与仓库计算支出的差异，指出单靠预算无法治理 AI 成本，因为 agent 循环、应用默认调用大模型或开发者全天使用编码 agent 都可能快速消耗 credits。作者提出三层控制：资源预算、每用户配额和 Cortex AI Gateway，分别像烟雾探测器、限制单人和塑造路径，各有盲点。文中还标注截至 2026 年 9 月 21 日的状态：资源预算和共享资源预算 GA，每用户配额 GA 但 AI Gateway 域为 Preview，Cortex AI Gateway 自 2026 年 9 月 15 日起为 Preview。","why_it_matters":"Snowflake 用户和 AI 数据平台团队可借此理解 AI 成本治理为何不同于数仓成本，并获得预算、配额、网关三层落地的边界与组合思路。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Snowflake"],"importance":77,"heat":57,"pinned":false,"published_at":"2026-09-28T22:01:06+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/871c27bf0387.html"}},{"event_id":"d4cef4293519","title":"Cloudflare推出智能体开发生命周期，取代传统SDLC","summary":"Cloudflare提出智能体开发生命周期，用自动化软件工厂替代传统软件开发生命周期，通过Workflows编排层与@cloudflare/ci工具链支持智能体自主完成开发、测试、部署和自我改进。平台强调可编程、水平扩展、事件驱动，为每个智能体创建预览部署并并行测试生产环境，同时提供OpenTelemetry兼容的可观测性与基于短期凭证的智能体访问模型。","why_it_matters":"Cloudflare将Agent工作流、可观测性和访问控制组合成面向AI工程的基础设施，对关注Agent平台化、CI/CD演进和生产评估的数据与AI平台从业者有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","Data Agent"],"vendors":["Cloudflare"],"importance":75,"heat":58,"pinned":false,"published_at":"2026-09-29T06:17:00+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["InfoQ 中文"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/d4cef4293519.html"}},{"event_id":"73a1ea512cd9","title":"Lightcast发布2025人才吸引记分卡","summary":"Lightcast发布《2025 Talent Attraction Scorecard》，基于人口增长、就业增长、人口结构和薪资数据，对美国各州及大都市区/小都市区的人才吸引力进行排名。佛罗里达州稳居人才吸引和就业增长第一，得克萨斯州第二；怀俄明州升至第4，爱达荷州第3。大都市层面，领先都会区形成从山地西部延伸至阳光地带和东南部的走廊，前十大都会区中五个在佛罗里达、三个在得克萨斯，达拉斯-沃斯堡和奥斯汀分列第一、第二。报告还总结六项人才流动趋势，供社区领导者制定人才吸引策略并对比周边地区。","why_it_matters":"该报告用人口、就业、薪资等数据给出美国州与都会区人才吸引力排名及流动趋势，适合关注组织人才、区域劳动力市场和数据驱动决策的从业者参考。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Lightcast"],"importance":74,"heat":33,"pinned":false,"published_at":"2026-08-15T21:07:18.061000+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Lightcast Research"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/73a1ea512cd9.html"}},{"event_id":"d2e6d3dce3a0","title":"Redshift Iceberg 写入支持 Part 3：模式与分区演进","summary":"AWS 官方博客 Part 3 以客户和订单数据集为例，演示如何通过 ALTER 操作演进 Amazon Redshift 中的 Apache Iceberg 表模式与分区布局。操作包括重命名/新增/删除列、扩展列类型、设置表属性，以及新增/删除/替换分区字段，这些变更均为元数据操作，无需重写数据或重建管道。文章还介绍在 Amazon S3 Tables 目录中创建 AWS Lake Formation 资源链接，以单一权限模型向其他分析引擎共享表。该系列前两部分分别覆盖 Iceberg 表创建与写入，以及 DELETE/UPDATE/MERGE 行级修改。","why_it_matters":"Redshift 对 Iceberg 的写入与 ALTER 演进能力，关系到湖仓架构中多引擎共享、模式变更和权限治理的实现方式。数据平台从业者可借此了解如何避免重写数据和重建管道来维护 Iceberg 表。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["AWS","Amazon Redshift","AWS Lake Formation","Amazon S3 Tables"],"importance":68,"heat":53,"pinned":false,"published_at":"2026-09-28T23:48:35+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/d2e6d3dce3a0.html"}},{"event_id":"82b17f45b54e","title":"Genie One 企业级推广分步 playbook","summary":"区域销售总监想了解东北 pipeline 本季走弱的原因，却要等懂可信数据的分析师到周四，最终只能在缺少答案的情况下决策。Genie One 旨在让业务人员用自然语言提问，获得基于受治理数据并引用来源的回答，并快速启动后续多步工作。原文认为，AI 推广停滞常因一次性铺开过多数据域、不同团队对“活跃客户”定义不一、语义层无人负责且缺乏答案校验机制。其落地 playbook 建议从窄问题集开始，先赢得早期采用者信任，再依据反馈逐步扩展到更多业务线，并包含 Genie One、领域特定 Genie Agents、Genie Ontology 等组件。","why_it_matters":"对数据从业者而言，这是一份 Data Agent/ChatBI 在企业内推广的序列化方法：先解决语义一致、来源引用和答案校验，再通过早期采用者扩展到业务线，对减少 AI 分析工具落地失败有参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent","语义层"],"vendors":["Databricks"],"importance":66,"heat":52,"pinned":false,"published_at":"2026-09-29T00:30:00+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/82b17f45b54e.html"}},{"event_id":"fa2922eb6e68","title":"Anthropic发布经济指数连接器，让Claude直接查询AI使用数据","summary":"Anthropic推出Economic Index连接器，允许用户在Claude中直接查询该指数数据。该指数衡量AI在经济中的实际使用情况，用户可询问哪些职业使用AI最多、教师用Claude做什么等。连接器在claude.ai中一分钟启用，无需安装，并会提示数据局限性。完整数据集仍在其网站免费提供。","why_it_matters":"提供了一种通过对话查询AI使用经济数据的范式，对Data Agent和分析Agent的产品设计有参考价值，同时揭示了AI对劳动市场的实际影响数据。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":["Anthropic","Claude"],"importance":65,"heat":29,"pinned":false,"published_at":"2026-08-26T00:13:14+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Anthropic Economic Index"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/fa2922eb6e68.html"}},{"event_id":"167559854496","title":"你的 Postgres 能扛住坏查询吗？","summary":"该文比较 ClickHouse Managed Postgres、Cloud SQL、PlanetScale 和 Amazon RDS 在递归查询耗尽内存时的表现，关注查询失败与集群存活。文章还解释 Postgres 的 work_mem 默认仅 4MB，且限制按查询计划中的操作而非整条查询生效，实际内存可远超该值。作者认为，在托管 Postgres 选择中，异常负载下的可靠性是一个常被忽略的维度，尤其当数据库由 Agent 自动配置和驱动时。","why_it_matters":"对数据库选型和平台可靠性评估有参考价值：它把“坏查询”下的故障隔离与集群存活作为托管 Postgres 的比较维度，并拆解 work_mem 等内存调优陷阱。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["ClickHouse","Cloud SQL","PlanetScale","Amazon RDS"],"importance":65,"heat":52,"pinned":false,"published_at":"2026-09-28T23:37:06+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["ClickHouse Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/167559854496.html"}},{"event_id":"052a4392ec5b","title":"2023人才吸引力记分卡：美国各州与郡县排名","summary":"Lightcast发布2023 Talent Attraction Scorecard，基于其数据平台分析美国各州、大县和小县的就业增长、教育程度、区域竞争力和迁移等指标。报告使用IRS报税地址变更数据追踪人口迁移，发现肯塔基州在迁移类别排名第4、密苏里州第5，偏离阳光地带和远程办公热门目的地的常规趋势。山区西部表现突出，爱达荷州、犹他州、亚利桑那州、内华达州等地在就业增长或教育程度进入前十，综合排名爱达荷第4、犹他第6、亚利桑那第8、内华达第9。报告旨在帮助社区和区域强化积极因素并识别增长所需调整。","why_it_matters":"用IRS迁移、就业与教育数据构建区域人才吸引力排名，展示数据驱动的人才与区域增长分析，对关注组织人才和劳动力市场数据应用的从业者有参考价值。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Lightcast"],"importance":65,"heat":29,"pinned":false,"published_at":"2026-08-15T21:07:57.662000+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Lightcast Research"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/052a4392ec5b.html"}},{"event_id":"e2626ff1bf17","title":"一线员工调研：排班、薪酬透明度与数字工具期望差距扩大","summary":"DailyPay与Workday发布《The Frontline Worker Expectation Gap》研究，指出一线员工期望与雇主供给之间存在显著差距。78%的一线员工在接受新排班前会计算通勤、儿童照护等成本，46%在两次发薪之间借钱，69%每班后查看工资。排班控制权重要度72%但满意度仅51%；薪酬清晰度重要度84%但仅57%非常满意；移动工具重要度70%但满意度53%。报告称缩小这些差距可在招聘、留任与生产率上带来关键优势。","why_it_matters":"该研究用调研数据揭示一线员工体验指标与招聘、留任、生产率之间的关联，可作为组织人才与HR分析场景的数据驱动洞察案例。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Workday","DailyPay"],"importance":64,"heat":29,"pinned":false,"published_at":"2026-09-17T21:00:00+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Workday Newsroom"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/e2626ff1bf17.html"}},{"event_id":"b6c0f5d8a2e4","title":"营销与数据工程最常误解的24个数据术语","summary":"文章以“inactive customers”“real-time”等为例，说明营销团队与数据工程团队常对同一数据术语理解不同：前者可能指90天未购买，后者却按30天未打开应用定义；前者期待15分钟刷新，后者理解为秒级更新。文中围绕营销活动执行的五个问题，整理了24个常见误解术语，并给出营销与数据工程两方的对照定义。作者建议在项目开始前用这些定义澄清假设、对齐“客户”“受众就绪”“信号新鲜度”等含义，以避免活动返工。","why_it_matters":"帮助数据从业者理解营销侧对字段、事件、实时性等术语的真实预期，并给出可复用的对齐框架，减少数据交付与活动执行间的返工。","category":{"slug":"product","label":"数据产品"},"topics":["数据人"],"vendors":["Databricks"],"importance":59,"heat":46,"pinned":false,"published_at":"2026-09-28T15:01:10+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/b6c0f5d8a2e4.html"}},{"event_id":"0de08774e321","title":"制造业数据与AI：连接产品价值链","summary":"文章指出制造缺陷往往跨越机器设置、供应商批次、物流事件和质量系统，相关数据被分割在工厂、职能和系统边界中。它回顾了50多年前Joseph Harrington提出的计算机集成制造(CIM)愿景，并认为现代数据与AI平台正让连接产品价值链变得可行。核心跨阶段问题包括：受影响产品涉及哪些供应商批次、缺陷是否曾出现及纠正措施是否有效、哪些客户或服务案例可能受影响。文章强调制造商需要的是带治理和业务上下文的跨系统信息流，而不是更多孤立报表。","why_it_matters":"制造数据跨系统集成与AI平台落地是典型行业场景，涉及数据接入、治理和业务上下文，能帮助数据从业者理解制造价值链的数据架构与决策问题。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","供应链"],"vendors":["Databricks"],"importance":48,"heat":45,"pinned":false,"published_at":"2026-09-29T03:47:19+08:00","discovered_at":"2026-09-29T07:20:47.713356+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/0de08774e321.html"}},{"event_id":"c23dcf4cbf7b","title":"Snowflake 10.29 发布：按用户配额正式可用","summary":"Snowflake 发布 10.29 版本说明，按用户配额正式可用，可为账户内单个用户设置月度与日度信用额度，并按阈值通知。配额覆盖仓库计算与 AI 功能域，包括 AI Functions、Snowflake CoCo、Cortex Agents 和 Snowflake CoWork，并可自动阻止超限用户访问 AI。正式版更新包括阻止通知开关、按月度或日度限额定阈值、QUOTA_ACCESS_BLOCK_HISTORY 视图，以及配置传播时间约 5–10 分钟。","why_it_matters":"Snowflake 用户应关注按用户配额正式可用及其对 AI 功能访问控制的影响，这关系到成本治理、权限管理和 AI 平台运营。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Snowflake"],"importance":80,"heat":58,"pinned":false,"published_at":null,"discovered_at":"2026-09-28T21:58:23.837516+08:00","sources":{"count":1,"names":["Snowflake Release Notes"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/c23dcf4cbf7b.html"}},{"event_id":"7fd21eb8c5a2","title":"数据揭示 Reddit 刀具推荐或存水军操纵","summary":"Hacker News 热帖（26 赞）中，作者用数据调查 Reddit 刀具社区是否存在水军。作者微调 GLiNER 模型，从 r/knives、r/chefknives 等六个 subreddit 评论中抽取品牌、型号和钢材。初步发现某厨师刀品牌在“该买什么”类提及中有 31% 来自 5% 的账号，是随机预期的 4 倍。随后作者拉取这些账号历史，并预先定义 astroturfing 的数据模式以判断推荐是否被操纵。","why_it_matters":"该文把 Reddit 推荐社区的可信度问题转成可量化、可复核的数据分析，并用 NER 抽取品牌/型号/钢材，对做评论数据、推荐信号和风险识别的数据团队有方法参考。","category":{"slug":"insight","label":"AI分析"},"topics":["风险管理"],"vendors":[],"importance":78,"heat":62,"pinned":false,"published_at":"2026-09-28T21:30:54+08:00","discovered_at":"2026-09-28T21:58:23.837516+08:00","sources":{"count":1,"names":["Hacker News（数据关键词）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/7fd21eb8c5a2.html"}},{"event_id":"c243cf15e712","title":"chDB 为 Agent 记忆提供持久化层","summary":"chDB 是 ClickHouse 驱动的嵌入式 SQL OLAP 引擎。团队曾用 chDB 在单台笔记本上为 coding agent 保存项目规则、用户偏好、决策、原始转录和召回轨迹，运行数周后却无法把状态带到 CI、可能一小时即消失的沙箱或第二台笔记本。改用 ClickHouse server 后端虽可移植，但会把本地 recall 变成带凭据、连接管理和远程延迟的网络查询。chDB Durable Layer 试图把可恢复的分析状态存入自有对象存储，同时保留本地查询速度。","why_it_matters":"对构建 Data Agent/分析 Agent 的团队有参考价值：它具体讨论 Agent 记忆在本地嵌入式 OLAP、对象存储持久化与远程服务之间的工程权衡，而非停留在概念层。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":["ClickHouse","chDB"],"importance":72,"heat":53,"pinned":false,"published_at":"2026-09-28T17:42:20+08:00","discovered_at":"2026-09-28T21:58:23.837516+08:00","sources":{"count":1,"names":["ClickHouse Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/c243cf15e712.html"}},{"event_id":"d769b4f2c54f","title":"Forter：两周让200名团队成员成为Agent构建者","summary":"Forter首席工程师Ben Maraney分享如何降低AI Agent创建门槛，让技术和非技术员工都能参与。团队利用自定义MCP服务器、结合无代码与代码平台，并有意避开复杂RAG方案。他们还协调安全与法务团队，以加速R&D内部的Agent采用。标题称两周内将200名团队成员转化为Agent创建者。","why_it_matters":"该实践展示了企业内部规模化构建Agent的落地路径，涉及MCP、无代码/代码平台、RAG取舍与安全法务协同，对数据团队建设Data Agent和提升内部采用率有参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["组织人才"],"vendors":[],"importance":58,"heat":47,"pinned":false,"published_at":"2026-09-28T19:00:00+08:00","discovered_at":"2026-09-28T21:58:23.837516+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/d769b4f2c54f.html"}},{"event_id":"ae224a31c6ec","title":"DuckDB 1.5.6 发布：修复缺陷、崩溃与安全问题","summary":"DuckDB 发布 v1.5.6，这是 1.5（Variegata）系列的第 7 个补丁版本，包含缺陷修复、性能改进和安全补丁。更新修复了多行组 128 位 DECIMAL 的 min/max 错误、聚合统计在行组过滤时的崩溃、TemporaryMemoryManager 死锁等崩溃与内部错误。还包含 ALTER/DROP COLUMN、Arrow 类型扩展、JSON 渲染等通用缺陷修复，以及针对小块存储启用 ALP/ALP_RD 的性能改进。完整发布说明和安装方式见 GitHub 与安装页。","why_it_matters":"DuckDB 是广泛用于本地与嵌入式分析的数据引擎；此次补丁涉及正确性、崩溃、内存与性能修复，使用 1.5.x 的团队应评估升级。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["DuckDB"],"importance":58,"heat":44,"pinned":false,"published_at":"2026-09-28T08:00:00+08:00","discovered_at":"2026-09-28T21:58:23.837516+08:00","sources":{"count":1,"names":["DuckDB Engineering Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/ae224a31c6ec.html"}},{"event_id":"4c71ebfbdbe7","title":"AWS 为 Aurora DSQL 引入外键约束","summary":"AWS 宣布 Aurora DSQL 现已支持外键约束，应用可直接在数据库内实施引用完整性，并支持 CASCADE、SET NULL 等操作。该功能解决了用户长期反馈的采用阻碍。Aurora DSQL 在事务中通过快照验证和提交时冲突检测来执行外键，检查时不锁表，冲突事务会以序列化错误拒绝。AWS 建议应用实现重试逻辑，并避免频繁修改被引用键列，将变化值移到非键列以减少事务冲突。","why_it_matters":"关注数据库/数据基础设施的产品演进，外键约束补齐对 PostgreSQL 兼容分布式数据库迁移和生产一致性很关键，且包含实现机制与使用边界。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["AWS"],"importance":54,"heat":44,"pinned":false,"published_at":"2026-09-28T12:54:00+08:00","discovered_at":"2026-09-28T21:58:23.837516+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/4c71ebfbdbe7.html"}},{"event_id":"8886c0d9df8a","title":"DuckDB 发布 Claude Code 数据技能插件","summary":"DuckDB 团队发布 duckdb-skills 插件，让 Claude Code 通过 /duckdb-skills:skill-name 调用 DuckDB CLI。该插件可读取本地文件、网络文件及登录后的 Iceberg 表，并执行查询、格式转换、对象存储探索、空间数据处理、文档搜索和会话回忆。示例中 Claude 首次查询因列名猜错报错，读取错误后改用 trip_distance，统计出 184,362 条超过 10 英里的出租车行程。使用前需安装 DuckDB CLI，未找到时插件会提示安装。","why_it_matters":"为数据从业者展示如何把 DuckDB 作为 AI Agent 的数据访问与查询执行层，减少临时 Python 脚本和列名猜测，对构建更可靠的 Data Agent 有直接参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":["DuckDB"],"importance":79,"heat":36,"pinned":false,"published_at":"2026-09-16T08:00:00+08:00","discovered_at":"2026-09-28T05:24:22.311986+08:00","sources":{"count":1,"names":["DuckDB Engineering Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/8886c0d9df8a.html"}},{"event_id":"fe759b807f34","title":"Anthropic经济指数：Claude使用学习曲线","summary":"Anthropic 发布经济指数报告，基于 2026 年 2 月 5 日至 12 日的 Claude 使用数据，延续此前经济基元框架。报告发现 Claude.ai 用例更多样化，前 10 任务占比从 2025 年 11 月的 24% 降至 2026 年 2 月的 19%；编码任务继续从 Claude.ai 增强式使用迁移到 API 自动化工作流。高使用时长用户更可能尝试高价值任务，并更可能获得成功回复；约 49% 职业至少四分之一任务已用 Claude。","why_it_matters":"报告用第一方使用数据揭示 Claude 采用学习曲线、任务迁移和成功率差异，对组织评估 AI 采用、技能培养及 Agent 产品运营有参考价值。","category":{"slug":"product","label":"数据产品"},"topics":["组织人才"],"vendors":["Anthropic","Claude"],"importance":81,"heat":36,"pinned":false,"published_at":"2026-09-10T04:49:46+08:00","discovered_at":"2026-09-28T01:02:52.304122+08:00","sources":{"count":1,"names":["Anthropic Economic Index"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/fe759b807f34.html"}},{"event_id":"b5c945468d8b","title":"数据、模型、算力难分，Data+AI基础设施如何进化？","summary":"文章从云栖大会出发，讨论AI进入真实世界后，数据从模型输入变为贯穿智能产生、应用与优化的持续流动。阿里云升级MaxCompute AI计算引擎，将CPU、GPU与大模型Token调用纳入统一调度，并通过MaxFrame、SQL AI Function与Skill封装数据能力。具身智能场景中，穹彻智能的数据生产管线吞吐提升超10倍，并利用十万级弹性算力单元支撑任务波峰；义乌场景每天处理百万级图片，伴随数十亿级Token调用。文章认为数据墙、算法墙、算力墙已难以分开解决，数据质量、精细化标注与质检成为规模化关键。","why_it_matters":"Data+AI基础设施正从单一大数据计算走向CPU/GPU/Token异构协同与数据闭环，涉及MaxCompute、PAI等具体产品能力，对数据平台与AI平台从业者有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["阿里云","MaxCompute","PAI"],"importance":73,"heat":39,"pinned":false,"published_at":"2026-09-25T00:34:30+08:00","discovered_at":"2026-09-28T01:02:52.304122+08:00","sources":{"count":1,"names":["InfoQ 中文"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/b5c945468d8b.html"}},{"event_id":"88cb64f37624","title":"BigQuery新增六个增强分析TVF函数","summary":"Google Cloud BigQuery新增一套增强分析表值函数（TVF），用AI、机器学习和统计方法自动化洞察发现与模式解释。首批六个函数包括AI.KEY_DRIVERS、AI.CAUSAL_EFFECT、ML.CORRELATION、ML.DETECT_CHANGE_POINTS、ML.TREND、ML.SEASONALITY，分别用于归因、因果影响、相关性、变点、趋势和季节性。这些函数在数据所在位置运行，减少导出到外部工具，并输出结构化SQL，可作为AI Agent技能集成，支持自动化和对话式数据调查。","why_it_matters":"BigQuery把归因、因果、趋势、季节性等增强分析能力直接做进SQL层，数据团队可在仓内完成诊断并接入Agent工作流；关注平台AI化和分析自动化的人值得看。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Google","Google Cloud","BigQuery"],"importance":68,"heat":31,"pinned":false,"published_at":"2026-09-14T08:00:00+08:00","discovered_at":"2026-09-27T13:22:28.026332+08:00","sources":{"count":1,"names":["Google Cloud Data Analytics Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/88cb64f37624.html"}},{"event_id":"32238a149cc1","title":"Google Cloud Dataflow 新增大规模AI工作负载功能","summary":"Google Cloud 宣布 Dataflow 面向大规模 AI 工作负载的新功能：Dataflow 批处理作业的 Pause/Resume 正式可用，并支持由 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 驱动的 G4 VM。Pause/Resume 可让失败的长时批处理作业从中断处恢复，而不是从头重跑，也可按优先级暂停/恢复作业以动态重分配 GPU/TPU 等加速资源。G4 VM 支持为训练、评估和推理等场景提供额外推理算力。Google Cloud 称这些能力可提升计算效率、开发效率和成本优化。","why_it_matters":"Dataflow 是 Google Cloud 数据与 AI 管线的重要组件；此次更新涉及长时批处理容错恢复、资源动态调度和 GPU 算力接入，直接影响 AI 数据准备/推理管线的成本与可靠性，值得数据平台与数据工程团队关注。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Google","Google Cloud"],"importance":66,"heat":30,"pinned":false,"published_at":"2026-09-14T08:00:00+08:00","discovered_at":"2026-09-27T13:22:28.026332+08:00","sources":{"count":1,"names":["Google Cloud Data Analytics Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/32238a149cc1.html"}},{"event_id":"8ff434fbf312","title":"Docker Cloud Sandboxes：跨笔记本与云的一致沙箱抽象","summary":"Docker 推出 Cloud Sandboxes，为在 Docker 托管基础设施上运行 AI 编码代理提供安全、托管的执行环境。该平台基于硬件强制的 microVM 隔离，提供一致的执行环境与统一 CLI 工作流，可用 sbx move 命令在本地与云端之间迁移沙箱。它是此前本地版 Docker Sandboxes 的演进，应对开发者并行运行多个长时程代理任务的需求；Kits v3 规范则将预配置沙箱打包为标准 OCI 镜像。","why_it_matters":"内容围绕 AI 编码代理的沙箱执行环境与开发者工作流，属于 AI 开发基础设施话题，未直接涉及数据平台、BI 或数据分析场景，故不推荐给数据从业者。","category":{"slug":"agent","label":"Data Agent"},"topics":[],"vendors":["Docker"],"importance":59,"heat":38,"pinned":false,"published_at":"2026-09-27T01:00:00+08:00","discovered_at":"2026-09-27T13:22:28.026332+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/8ff434fbf312.html"}},{"event_id":"bfde167efa74","title":"实验：dbt 项目对 AI Agent 究竟值多少","summary":"Fivetran 作者用同 4 张零售演示表向两个 AI Agent 提同一个问题（总营收是多少），Haiku 直接对明细行求和，Opus 先看订单表剔除了已取消订单并注明，两者给出自信却不同的答案。作者因此对比了 5 种接入同一 dbt 项目的方式，发现要求 Haiku 先读 dbt 文档后，其 join 问题的错误答案从 4 个降到 0 个；Semantic Layer 是唯一让两个模型都做到 0 错、且每个可信答案成本最低的接口。结论是对话式分析中，受治理的数据访问方式可能与模型本身同样重要。","why_it_matters":"用可量化的对照实验说明 Semantic Layer 相比裸 SQL 在准确率与成本上的价值，为 Data Agent/ChatBI 选型提供了直接依据。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent","语义层"],"vendors":["Fivetran","dbt Labs","MotherDuck"],"importance":91,"heat":47,"pinned":false,"published_at":"2026-09-25T01:38:12+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Fivetran Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/bfde167efa74.html"}},{"event_id":"4b8fffa27e50","title":"Anthropic经济指数：AI使用新度量","summary":"Anthropic发布经济指数报告，基于2025年11月Claude.ai及一方API的匿名对话，提出用户与AI技能、任务复杂度、自主性、成功率、用途五个维度。报告称Claude.ai可见超3000种工作任务，前10大任务占样本对话24%，增强型对话略超一半，而一方API以自动化使用为主。美国、印度、日本、英国、韩国在Claude.ai使用上领先，全球采用差异与人均GDP相关，美国各州采用差异与计算机和数学职业人员比例相关。数据覆盖消费者与企业使用及国家地区细分。","why_it_matters":"该报告用大规模真实对话样本量化AI在经济中的使用结构，为数据从业者理解AI采用差异、任务自动化与增强模式提供可核验的基准数据。","category":{"slug":"product","label":"数据产品"},"topics":["组织人才"],"vendors":["Anthropic","Claude"],"importance":90,"heat":45,"pinned":false,"published_at":"2026-09-10T05:22:54+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Anthropic Economic Index"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/4b8fffa27e50.html"}},{"event_id":"58f44ab1fece","title":"Amazon MSK 大型消费组扩展最佳实践","summary":"Amazon MSK 上扩展大型 Kafka 消费组时，重平衡期间 GroupMetadata 记录会写入内部 __consumer_offsets topic，组过大时可能超过默认 1 MB 限制，触发 RecordTooLargeException 和重平衡重试循环。本文解释消费组元数据如何增长、如何估算大小，并给出提高 topic 级大小限制的分步操作。文章还补充拆分消费组、调整分区数量和优化命名等策略，并讨论容量规划、监控及 Apache Kafka 4.0 中 KIP-848 在协议层的改进。","why_it_matters":"该文面向 Kafka/MSK 数据基础设施的生产运维，提供消费组扩展的具体故障机理、参数配置、容量规划与监控方法，对维护流处理平台的团队有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["AWS","Amazon MSK","Apache Kafka"],"importance":84,"heat":41,"pinned":false,"published_at":"2026-09-22T23:16:06+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/58f44ab1fece.html"}},{"event_id":"e21d73e20f8f","title":"从Kafka依赖到直连接入：Snowpipe Streaming Elastic Channels生产实践","summary":"文章介绍用 Snowpipe Streaming Elastic Channels 替代 Kafka 等中间消息总线，直接将数据流式写入 Snowflake 的生产级架构。作者用一个三行 SDK 调用从 MacBook 直接将 1,010 行数据流入 Snowflake，并展示了持久化确认、实时分析和异常检测能力。实现覆盖 RBAC、密钥对认证、Python SDK 生产者、Dynamic Tables 实时转换、至少一次投递去重与监控，所有 SQL 均在真实 Snowflake 账户验证并附完整代码仓库。","why_it_matters":"为数据工程师提供了替代 Kafka 缓冲层的可落地流式接入方案，含认证、去重、实时转换与监控全链路细节，对湖仓与实时分析架构选型有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析","湖仓"],"vendors":["Snowflake"],"importance":82,"heat":45,"pinned":false,"published_at":"2026-09-25T22:01:02+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/e21d73e20f8f.html"}},{"event_id":"b96997bdba83","title":"在 Databricks SQL 中运行开放决策模型","summary":"Databricks 官方博客介绍如何在 Databricks 上托管开放权重决策模型，并以 SemIf-OpenJev 为例在 SQL 中运行。流程由可导入 Notebook 完成：选择模型名/schema、选择 Serverless GPU、Run All；AI Runtime 提供无服务器 GPU 计算，自动下载模型、登记并创建 GPU Model Serving 端点。用户可通过 SQL 的 ai_query 直接调用任意自定义模型 API，把模型应用于受治理数据，例如将酒店评论分类为好/坏。文中还提到可用 AI Runtime 定制或后训练模型，并通过 Lakeflow 的生产作业调用。","why_it_matters":"该实践展示 Databricks 把开放权重模型接入受治理数据与 SQL 工作流的路径，覆盖从模型部署到 ai_query 调用和生产作业，对建设数据平台 AI 能力、降低 GPU 运维与调用成本的团队有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Databricks"],"importance":81,"heat":42,"pinned":false,"published_at":"2026-09-25T00:55:01+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/b96997bdba83.html"}},{"event_id":"a2e6f6d71810","title":"Snowflake托管Iceberg表的事件驱动Glue Catalog注册方案","summary":"Snowflake在2025_01 BCR版本中为托管的Iceberg表引入新写入路径，会在基础路径后追加8位随机后缀以保证表删除重建时的唯一性，导致Glue crawler抓取到 customers_f0xgvx1a 这类杂乱表名，影响用户写SQL探索数据。Glue本身不提供关闭该后缀或重命名的设置，作者在无法采用新Catalog服务的前提下，改用事件驱动方式将近实时地把表直接注册进Glue Catalog，成本仅每天几美分。文章也提示，已采用Horizon Catalog或其他兼容REST API的Catalog的组织不必自建此方案。","why_it_matters":"面向受限于既有AWS技术栈、无法引入新Catalog服务的数据团队，给出绕开Glue crawler随机后缀问题的可落地工程做法。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["Snowflake"],"importance":80,"heat":40,"pinned":false,"published_at":"2026-09-24T03:01:01+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/a2e6f6d71810.html"}},{"event_id":"478f1b088f17","title":"Delivery Hero 用 Apache Flink 重建实时广告测量","summary":"Delivery Hero 与 AWS 合作，将其广告测量管道从小时级批处理迁移到 Amazon Managed Service for Apache Flink 的实时流处理。该平台每秒处理数万条消息、每天数十亿广告事件，支撑 2025 年近 15 亿欧元的广告收入，覆盖约 65 个国家和超过 150 万餐厅及本地商户。新管道把基础设施成本降低一半以上，并达到旧系统无法实现的数据质量。旧系统按处理时间而非事件发生时间分桶，并通过同步 API 查询活动元数据，扩展后暴露出事件时间语义缺失和处理缓慢等结构性问题。","why_it_matters":"这是实时流处理在广告计费与测量场景中的一线工程实践，展示了事件时间语义、成本优化和数据质量之间的具体权衡，对构建实时数据平台有参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析"],"vendors":["AWS","Apache Flink"],"importance":80,"heat":42,"pinned":false,"published_at":"2026-09-25T00:09:12+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/478f1b088f17.html"}},{"event_id":"009c95673c3b","title":"Snowflake 10.32 发布说明：PERIOD 类型 GA","summary":"Snowflake 发布 10.32 版本说明，覆盖 2026 年 9 月 5 日至 9 月 9 日。该版本包含行为变更捆绑包 2026_07（默认禁用，管理员可启用测试）、2026_06（默认启用，可退出）和 2026_05（普遍启用，管理员不能再开关）。SQL 方面，PERIOD 数据类型正式可用，用于存储锚定的半开时间范围 [begin, end)，并提供 PERIOD_* 函数族。数据治理方面，ALTER TABLE 或 ALTER VIEW … MODIFY DATA METRIC FUNCTION 新增 FILTER 子句，可设置、替换或清除数据指标函数的行过滤条件，空括号 FILTER () 表示清除过滤。","why_it_matters":"这是 Snowflake 官方版本说明，涉及新数据类型与数据指标函数治理能力，使用 Snowflake 的数据平台和数仓从业者需关注行为变更状态并评估兼容性。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["Snowflake"],"importance":80,"heat":47,"pinned":false,"published_at":null,"discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Release Notes"]},"push":{"recommended":true,"reason":"importance_80"},"links":{"detail":"https://datahot.xiahongbin.com/e/009c95673c3b.html"}},{"event_id":"d44ed50d0181","title":"美国公共部门与私营部门AI岗位差异","summary":"Lightcast与Christos Makridis、Gil Alterovitz教授联合发布白皮书，比较美国公共部门与私营部门AI相关岗位的需求、薪资和学历要求。研究使用Lightcast 2017-2023年职位发布数据库，并沿用其与斯坦福HAI合作定义的AI岗位口径。私营部门AI岗位占比从2017年的0.5%升至2023年约2%，公共部门则基本持平在0.25%。私营部门AI岗位平均发布薪资高约50%，技术类AI岗位要求学历的可能性是公共部门两倍；2017-2023年私营部门每发布1个公共部门AI岗位，约对应174个私营岗位。","why_it_matters":"该报告用多年职位发布数据量化AI人才在公共/私营部门的需求、薪资与学历差距，并为联邦层面的技术人才招聘提供参考，适合关注AI人才市场与组织能力建设的数据从业者。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Lightcast"],"importance":79,"heat":36,"pinned":false,"published_at":"2026-08-15T21:14:08.155000+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Lightcast Research"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/d44ed50d0181.html"}},{"event_id":"1b6c9f3bf4a5","title":"从Cassandra到Snowflake：NoSQL数据集成蓝图","summary":"本文介绍利用Snowpark Python将Apache Cassandra数据集成到Snowflake的实践方案：借助官方DataStax cassandra-driver直接在Python环境中读取Cassandra行数据，并通过Snowpark DataFrame API生成单一SQL执行计划。方案支持在Snowflake内用Tasks或Snowpark Container Services进行无服务器化调度，并通过显式StructType声明模式，绕过pandas/pyarrow以降低内存开销。该方法尤其适合需要保留完整变更历史（SCD Type 2）的高规模源系统，典型场景如属性频繁变动的产品目录。","why_it_matters":"对需要将高吞吐NoSQL源接入数仓的数据工程师有直接参考价值，讲清了驱动直连、模式声明与无服务器调度的具体机制与边界。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓","数据人"],"vendors":["Snowflake","DataStax"],"importance":79,"heat":38,"pinned":false,"published_at":"2026-09-22T23:01:06+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/1b6c9f3bf4a5.html"}},{"event_id":"17690b235e46","title":"Anthropic经济指数：AI在美国及全球经济中的角色","summary":"Anthropic 发布第三份经济指数报告，基于 Claude 使用数据分析了 AI 在美国各州、不同国家和时间上的采用差异。报告首次详细评估美国各州 AI 使用差异，发现软件工程在几乎所有州和国家仍居首，但人均使用率最高的州并非编码主导；巴西用户用 Claude 做翻译和语言学习的频率约为全球均值 6 倍。跨国看，Claude 使用与收入强相关，低使用国家更频繁用 AI 自动化工作；随时间，“指令式自动化”任务占比从 27% 升至 39%。报告还纳入 Anthropic 一方 API 客户匿名数据，发现 API 用户比消费者更倾向自动化任务。","why_it_matters":"该报告用一手使用数据量化 AI 在全球经济与工作场景中的采用差异、自动化趋势和 API/消费者行为差异，可为判断 AI 落地阶段与业务自动化机会提供参考。","category":{"slug":"product","label":"数据产品"},"topics":[],"vendors":["Anthropic","Claude"],"importance":78,"heat":35,"pinned":false,"published_at":"2026-09-11T19:55:40+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Anthropic Economic Index"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/17690b235e46.html"}},{"event_id":"dfd3a445a252","title":"SageMaker Unified Studio 域级 VPC 网络配置指南","summary":"企业运营团队在 Amazon SageMaker Unified Studio 中运行域级 VPC 网络时，通常要支持数据工程、分析和机器学习等多个项目。每个项目都需要私有连接内部数据库、Amazon S3 桶和 AWS 服务；若缺少域级 VPC 配置，项目所有者需逐个与网络团队协调，导致子网选择不一致、VPC 端点缺失和故障排查困难。文章介绍如何为使用 IAM 认证的 SageMaker Unified Studio 域配置域级 VPC，包括选择子网与安全组、实现多可用区韧性、让无 VPC 项目继承域 VPC，以及何时必须重建项目并从项目内验证网络连通性。","why_it_matters":"数据平台与 ML 平台在 AWS 上的网络隔离、私有连接和安全审计是落地关键；此文给出 SageMaker Unified Studio 域级 VPC 的配置、继承与迁移边界，适合平台与数据工程团队参考。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["AWS","Amazon SageMaker"],"importance":77,"heat":39,"pinned":false,"published_at":"2026-09-24T02:36:56+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/dfd3a445a252.html"}},{"event_id":"44fb880837be","title":"Visier研究：48%员工夸大AI使用，表演式AI源于领导层不清","summary":"Visier与第三方研究机构合作，对1000名美国全职员工进行调查，并访谈医疗、金融、HR、软件等领域员工。报告显示，48%员工至少有时夸大自己的AI使用或专业程度；54%认为过去两年角色或职业因AI显著变化；59%不相信或不确定雇主有清晰计划应对AI对岗位的影响。报告将这种“表演式AI”归因于领导层计划不清晰，并指出员工最希望获得培训和透明度，而非岗位保障。","why_it_matters":"用1000名员工调查和访谈数据解释职场AI采用中的表演式行为，给出组织人才与AI转型的量化发现，对数据/技术团队的AI落地与变革管理有参考价值。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Visier"],"importance":75,"heat":36,"pinned":false,"published_at":"2026-09-22T08:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Visier Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/44fb880837be.html"}},{"event_id":"6f777771ef7a","title":"Agent Harness 解析：概念与两种构建方式","summary":"本文以金融助手 FinBot 为例，讲解 agent harness（智能体生产化所需的模型外围层）的开发与运维两层结构。文章对比 AWS AgentCore Harness（托管式 HaaS）与 Kubernetes 上 LangChain 配合 Agent Router（原 Envoy AI Gateway）的自管方案，比较二者在工具、记忆、模型访问、成本控制与可观测性上的处理差异，并讨论团队在控制权、成本与可移植性之间的取舍。指出真正的区别不在能力有无，而在于由谁运维、支付多少以及是否用控制换速度。","why_it_matters":"为 Data Agent 从 demo 走向生产提供了清晰的架构分层与托管/自管选型框架，对负责智能体落地的数据与平台工程团队有直接参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":["AWS","LangChain"],"importance":74,"heat":41,"pinned":false,"published_at":"2026-09-25T17:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/6f777771ef7a.html"}},{"event_id":"62fa1dd33601","title":"爱分析访谈飞数：AI接管数据生产，标注升级为数据服务","summary":"爱分析访谈飞数执行总裁谭昶，讨论AI如何改造数据生产。飞数前身可追溯至科大讯飞2001年成立的语音制作部门，2024年4月孵化成立安徽飞数，定位人工智能高质量数据生产者。原文称语音、语言、文本等成熟场景中超过90%的数据可由模型自动处理，但医疗、教育等高标准场景最后1%仍需专家兜底。飞数业务覆盖规划、采集、治理、标注、质检和持续运营，并判断具身数据将从规模竞争转向知识密度竞争。","why_it_matters":"数据标注正升级为覆盖治理、质检与持续运营的数据生产服务，其中自动化与专家分工、高质量数据集评价标准对数据治理和数据平台团队有参考价值。","category":{"slug":"product","label":"数据产品"},"topics":["数据人"],"vendors":["飞数","科大讯飞"],"importance":74,"heat":44,"pinned":false,"published_at":null,"discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["爱分析"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/62fa1dd33601.html"}},{"event_id":"382fa24348cc","title":"Lakebase与TiDB X：AI需求下的数据库架构","summary":"文章对比Databricks的Lakebase（基于对象存储的无服务器Postgres）与TiDB X的架构设计，两者都将持久化数据放在对象存储中、与计算分离。作者指出AI Agent需要快速创建、低成本闲置、可安全试错的数据库生命周期，而不只是查询速度。Lakebase对单一Postgres主库做分支，TiDB X把分支能力带入分布式SQL；TiDB Cloud Lake则通过导出加载实现独立分析计算，而非零拷贝访问。","why_it_matters":"对关注AI Agent工作负载下数据库架构演进的数据从业者，文章拆解了计算存储分离、数据库分支等关键机制及其生产验证缺口。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓","Data Agent"],"vendors":["PingCAP","TiDB","Databricks"],"importance":74,"heat":37,"pinned":false,"published_at":"2026-09-23T23:35:42+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["TiDB Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/382fa24348cc.html"}},{"event_id":"2f57edb18020","title":"Fountain 在 ClickHouse Cloud 上重建数据平面支撑 Cue","summary":"Fountain 为零售、物流、餐饮、医疗和酒店等前线时薪员工提供招聘与排班平台，已处理超 9100 万申请和 1400 万入职。过去其分析依赖三小时批处理，架构包含 13 个 Postgres、4 个 MongoDB，经第三方复制到 S3/Iceberg/Parquet，再进入 BigQuery 和 ClickHouse。为支撑 agentic AI 平台 Cue，Fountain 用 ClickPipes 和 ClickHouse Cloud on AWS 重建数据平面，将分析延迟从三小时降至两分钟以内，并实现亚秒级查询。新架构还使成本降低约 66%，在 Open House SF 2026 上由数据平台负责人和高级分析工程师分享。","why_it_matters":"对正在建设实时数据平面、评估 ClickHouse/湖仓迁移或为 AI Agent 提供低延迟数据的团队有直接参考，尤其关注延迟、成本和架构简化。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析","平台AI化"],"vendors":["ClickHouse","AWS","BigQuery","PostgreSQL","MongoDB"],"importance":73,"heat":36,"pinned":false,"published_at":"2026-09-22T22:52:36+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["ClickHouse Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/2f57edb18020.html"}},{"event_id":"fb7a958f0064","title":"Perplexity 自研 Rust 键值库 CobbleDB 替换 DynamoDB，查询延迟降低 5 倍","summary":"Perplexity 将核心搜索服务层从 Amazon DynamoDB 迁移至自研分布式键值存储 CobbleDB（用 Rust 编写）。该迁移解决了在大查询量下向大语言模型提供多 KB 文档批次所引发的延迟与成本瓶颈。通过将持久化文档存储与热层检索解耦，工程团队实现批量读取延迟降低五倍，整体存储费用至少降低 20%。","why_it_matters":"这是一次典型的自研数据基础设施替换云托管服务的实践，给出了延迟、成本、吞吐等具体数字与架构解耦思路，对评估键值存储选型与 LLM 检索场景的数据从业者有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析"],"vendors":["Amazon DynamoDB","Perplexity"],"importance":72,"heat":40,"pinned":false,"published_at":"2026-09-25T22:14:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/fb7a958f0064.html"}},{"event_id":"f76140abac25","title":"Concurrence 用 Unity Gateway 治理万亿级临床 AI","summary":"Concurrence 在 Databricks 上运行临床 AI 代理，近 30 天处理约 1008 亿输入 token 和 1120 万次 LLM 调用，年化约 1.2 万亿输入 token。为满足合规与可靠性，它用 Lakebase 承载运营和对话状态，用 Unity Catalog 治理数据与 AI 资产，用 Unity Gateway 集中管理 AI 访问与安全。Concurrence 将新信息记录为不可变事件并计算当前患者状态，保留来源与溯源，形成其 world model，使代理获得一致的患者视图和历史。文章展示了高风险医疗场景下，代理测试、受治理数据与 AI 访问如何支撑规模化生产。","why_it_matters":"数据从业者可看到湖仓、目录与 AI 网关如何统一支撑规模化 Agent 的状态、治理与安全，并了解医疗临床场景的生产 token 指标。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","湖仓"],"vendors":["Databricks"],"importance":72,"heat":36,"pinned":false,"published_at":"2026-09-23T20:19:55+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/f76140abac25.html"}},{"event_id":"91c492ef27ba","title":"用Databricks系统表查询理解成本的Top 5","summary":"Databricks 官方博客介绍了用于理解 Databricks 成本的五个系统表查询。系统表可提供关于 Databricks 使用方式和费用构成的丰富信息。文章面向需要分析、监控或优化 Databricks 支出的数据团队。读者可据此通过系统表查询定位成本来源。","why_it_matters":"该文提供官方系统表查询实践，对需要监控和优化 Databricks 使用成本的数据平台团队有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["Databricks"],"importance":72,"heat":35,"pinned":false,"published_at":"2026-09-23T00:22:39+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/91c492ef27ba.html"}},{"event_id":"ddc6673776cd","title":"DuckDB 与 Hugging Face：直接查询数据集","summary":"Hugging Face 是机器学习社区发布和查找数据集的主要平台，而 DuckDB 是进程内分析数据库，可直接查询 CSV、Parquet 等文件，无需安装或运行服务器与数仓。自 2024 年 5 月 22 日发布的 DuckDB v0.10.3 起，用户可通过 hf:// 协议将 SELECT 语句直接指向 Hugging Face Hub 上的数据集，无需先下载。本文介绍该集成的工作原理及其适用场景。","why_it_matters":"该集成让数据从业者无需下载即可用 SQL 直接查询 Hugging Face 上的 Parquet/CSV 数据集，简化了数据获取与探索流程。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓","平台AI化"],"vendors":["DuckDB","Hugging Face"],"importance":71,"heat":38,"pinned":false,"published_at":"2026-09-25T08:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["DuckDB Engineering Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/ddc6673776cd.html"}},{"event_id":"72a01216eb46","title":"Moeve 用 Athena 标准化数据湖中的 dbt 运行","summary":"Moeve 的 analytics 团队用 dbt 构建转换，但项目增多后运行逻辑分散在各团队管道中，计算引擎不统一、成本可见性差。公司因此构建了基于 Amazon Athena 的集中式无服务器 dbt 运行方案，并用 AWS Step Functions 和 Fargate 解耦编排。方案把运行参数存入 Amazon DynamoDB，将结果发布到 Amazon EventBridge，使运行层与编排层独立演进。新 dbt 项目的接入时间从数天缩短到约 15 分钟。","why_it_matters":"对需要规模化运行 dbt、统一数据湖转换和优化成本治理的数据平台团队有直接参考价值；文中给出了编排解耦、参数管理和事件驱动的具体架构。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["AWS","dbt Labs","Amazon Athena"],"importance":71,"heat":35,"pinned":false,"published_at":"2026-09-22T23:13:31+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/72a01216eb46.html"}},{"event_id":"e29112497566","title":"Meta Muse macOS客户端曝零日漏洞：单个调试配置可绕过系统安全","summary":"安全研究员Patrick Wardle披露Meta新发布的macOS版Muse桌面客户端存在未修补零日漏洞。该漏洞源于未公开的配置键endo_voyager_dictation_endpoint，本地非特权进程可静默覆写该配置，将听写音频与账户令牌转发至攻击者服务器。由于Meta未发布正式安全公告，该漏洞目前无CVE编号。攻击者可借此窃取输入内容与账户凭据，并进一步实施提示注入。","why_it_matters":"属于AI客户端安全漏洞而非数据领域资讯，与本站五个覆盖领域均无直接关联。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["Meta"],"importance":70,"heat":37,"pinned":false,"published_at":"2026-09-24T22:14:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/e29112497566.html"}},{"event_id":"2f576701d80e","title":"在托管计算上用工作负载证明换取自有身份","summary":"Netflix 工程博客介绍如何在 Amazon EMR 等托管计算上为 Apache Spark 工作负载打通身份体系。组织通常并行运行两套身份系统：云厂商的 IAM 角色/实例配置/执行角色，以及内部服务实际校验的自有身份。文章讲述如何让一个仅有 AWS 身份的工作负载最终获得一等公民的内部身份，并强调交换过程本身简单，难的是让它可信。","why_it_matters":"涉及数据平台的身份认证与工作负载证明机制，对在托管云环境上运行数据作业、需要统一内部权限与审计的数据平台工程师有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":[],"importance":70,"heat":39,"pinned":false,"published_at":"2026-09-26T00:01:03+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Netflix Technology Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/2f576701d80e.html"}},{"event_id":"e8e737d1c54c","title":"从dbt Core v1迁移到Snowflake上的dbt v2实践指南","summary":"dbt v2于2026年9月16日正式GA，将代号Fusion的引擎产品化。本文给出一套Snowflake存量dbt项目的迁移路径：先升级到dbt v1.12并处理废弃项与包兼容性，再运行dbt parse --use-v2-parser，随后切换到v2并编译测试。作者指出真正关键的不是引擎本身，而是迁移前的准备工作，并提醒切换后静态分析可能暴露v1未标记的仓库专属SQL，需区分解析器限制与实际的Snowflake运行时问题。","why_it_matters":"面向数据工程团队的一手迁移实践，给出可逐步执行的命令与验证顺序，并点出v1到v2架构变化与静态分析的边界，对正在做dbt升级的团队有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["Snowflake","dbt Labs"],"importance":69,"heat":37,"pinned":false,"published_at":"2026-09-24T22:01:05+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/e8e737d1c54c.html"}},{"event_id":"34bc72cca022","title":"用备份为 Snowflake 数据加一层保护","summary":"文章介绍 Snowflake Backups 在 Time Travel 之外提供的数据保护能力，可对表、模式和数据库等对象创建快照。备份支持手动或自动执行，并通过备份策略定义计划与保留期，所有 Snowflake 版本均可用，保留锁和法律保留等高级功能需 Business Critical 及以上版本。文中以每日备份 gold 模式并保留 30 天为例，演示了创建 BACKUP_ADMIN 自定义角色、专用仓库并授予最小权限的完整配置流程。","why_it_matters":"面向数据平台从业者，给出 Snowflake 备份的最小权限角色设计与策略配置实操，可作为数据保护与治理的落地参考。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["Snowflake"],"importance":69,"heat":37,"pinned":false,"published_at":"2026-09-25T03:01:01+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/34bc72cca022.html"}},{"event_id":"f79f63c63e0d","title":"S&P Global 用 Databricks Genie+MCP 实现数据对话","summary":"S&P Global Energy 希望让客户通过自然语言访问其跨商品的结构化数据，以更快做出决策。其数据覆盖化学品、原油、成品油、天然气与电力、LNG 等，分布在 Databricks 和多个非 Databricks 来源。团队评估多种方案后，采用 Databricks Genie Agents 作为受管 MCP 服务器，并通过 MCP 代理层组合成领域专用包。业务专家（SME）按数据集组维护聚焦的 Genie Agent，使客户和自有助手能获得可信、受治理的答案。","why_it_matters":"该案例展示了如何用 Genie Agents 与 MCP 将复杂结构化数据资产开放给 AI 智能体，涉及数据上下文、治理与 MCP 组合架构，对构建 ChatBI/Data Agent 的团队有直接参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":["Databricks","S&P Global"],"importance":68,"heat":39,"pinned":false,"published_at":"2026-09-26T00:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/f79f63c63e0d.html"}},{"event_id":"95c5516f30c3","title":"提升 Snowflake AI_EXTRACT 在密集多章节金融文档上的准确率","summary":"本文由 Kipi.ai 与 Snowflake 作者撰写，聚焦财富管理公司每月收到的大量图片格式客户财务文档（开户包、合并对账单、退休计划摘要、信托文件等）。这些文档单页常含 6-10 个章节，字段相似（金额、百分比、日期、账号），一次性整页抽取时会出现字段归属错误，准确率仅 70-80%，其余 20-30% 仍需人工复核。文章提出改进思路：不是更换引擎，而是把问题切窄——按章节拆分后再调用 AI_EXTRACT。","why_it_matters":"为使用 Snowflake AI_EXTRACT 做文档抽取的数据团队提供了多章节密集文档的准确率优化实践，直接关系到非结构化数据入仓与自动化流程的可靠性。","category":{"slug":"platform","label":"AI 数据平台"},"topics":[],"vendors":["Snowflake"],"importance":68,"heat":39,"pinned":false,"published_at":"2026-09-26T03:01:02+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/95c5516f30c3.html"}},{"event_id":"17b5e344d515","title":"美国劳动力市场快照：职位发布量四年首次同比转正","summary":"Indeed 招聘职位指数（JPI）9月18日升至103.5，为3月底以来最高，较疫情前水平高约3%，环比增长1.5%，同比+0.7%，是近四年来首次同比转正。新增职位（发布7天内）指标为94.0，较疫情前低约6%。招聘广度改善：60%的职业门类职位发布量高于疫情前基线，高于6月初的51%；工程与个人护理/家庭健康需求偏强，科技行业仍较疲软。报告认为对在职者而言低裁员率意味着市场稳定，但求职者压力仍在。","why_it_matters":"这是用第一方招聘数据回答\"劳动力需求是否见底\"的典型数据驱动分析，其指标口径、分行业拆分与拐点判断方法，对做业务监测和指标解读的数据从业者有参考价值。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Indeed"],"importance":68,"heat":36,"pinned":false,"published_at":"2026-09-24T18:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Indeed Hiring Lab"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/17b5e344d515.html"}},{"event_id":"e7dff550bb3c","title":"在Databricks上构建Agent化安全审查","summary":"作者在已有安全审查自动化基础上，用Agent层扩展流程，目标不是替代人，而是让系统理解请求、应用安全标准、补全缺失信息并识别人工介入时机。首个版本只覆盖一条审查路径，随后团队将其扩展为支持更多安全受理与审查环节的多个Agent。实现全部构建在Databricks上：Unity Catalog提供受治理的标准、请求、证据、决策与系统输出空间，Databricks托管基础模型（Claude Haiku、Sonnet、Opus）负责分类、风险评估和起草要求，Lakeflow Jobs在Serverless Compute上编排Notebook工作流，Databricks Apps提供受理应用和高管看板。请求在统一受治理表中连续流转，从Intake到Reasoning逐步处理。","why_it_matters":"对数据从业者的价值在于展示如何在受治理的数据平台上落地生产级Agent：统一元数据/权限、模型编排、应用入口和人在回路如何组合，可迁移到安全、风控等专家审查场景。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","风险管理"],"vendors":["Databricks"],"importance":67,"heat":35,"pinned":false,"published_at":"2026-09-24T10:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/e7dff550bb3c.html"}},{"event_id":"c6f8c8502ebe","title":"2022人才吸引力评分卡：排名与人才发展建议","summary":"Lightcast发布第七届Talent Attraction Scorecard，基于教育、整体就业变化、迁移、技能岗位变化、竞争效应和技能岗位空缺等指标对美国各县排名。数据覆盖2017—2021年教育与就业数据，以及2016—2020年IRS迁移数据，并按大、小、微型县及新增州级排名分类。报告指出在人口干旱、劳动力短缺、供应链压力和衰退风险下，维持人才管道至关重要，并给出相应人才建议。报告还提到住房正成为经济发展首要议题，2022年一项调查显示60%受访者称所在机构正努力增加住宅库存。","why_it_matters":"该报告展示如何用教育、就业、迁移、岗位空缺等多源数据构建人才吸引力评分，并支持社区与企业的组织人才决策，适合关注数据驱动业务分析的数据从业者。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Lightcast"],"importance":67,"heat":30,"pinned":false,"published_at":"2026-08-15T21:08:33.360000+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Lightcast Research"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/c6f8c8502ebe.html"}},{"event_id":"9ad992862769","title":"MCP新规范取消会话绑定，简化AWS部署","summary":"AWS架构博客解读最新Model Context Protocol规范，该规范移除了协议级会话、粘性会话要求和会话存储，使远程MCP服务器请求可独立路由至任意实例，简化水平扩展。规范还取消了initialize握手与Mcp-Session-Id头，新增可选的server/discover操作，并引入MRTR机制替代需保持长连接的服务器发起请求。新的Mcp-Method、Mcp-Name头支持网关路由与限流，W3C Trace Context支持分布式追踪，ttlMs与cacheScope提供缓存控制。AWS指出状态管理、重试与可观测性责任转移至周边基础设施，Lambda成为契合请求-响应模式的部署选项。","why_it_matters":"MCP是Data Agent与AI数据平台工具集成的关键协议，其无状态化直接影响Agent后端架构、扩展性与运维成本，数据基础设施从业者需了解部署模式变化。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent","平台AI化"],"vendors":["AWS"],"importance":67,"heat":38,"pinned":false,"published_at":"2026-09-25T20:58:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/9ad992862769.html"}},{"event_id":"30b83b28a4ab","title":"AI Agent 状态解析：持久化记忆与任务进度","summary":"文章解释 AI Agent 状态是记忆、任务进度与上下文的持久化记录，使 Agent 能在重启、重试和多步任务中存活。据 LangChain 2026 年报告，57% 的组织已有 Agent 在生产环境运行，较上年 51% 上升；输出质量以 32% 成为扩展最大障碍，超过成本与延迟。文章区分了上下文窗口与状态，并介绍了架构模式及 TiDB 作为数据层的定位。","why_it_matters":"对构建 Data Agent/分析 Agent 的从业者而言，状态持久化直接决定多步分析任务能否可靠恢复与审计，是落地生产的关键工程问题。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":["PingCAP","TiDB","LangChain"],"importance":67,"heat":32,"pinned":false,"published_at":"2026-09-22T05:35:41+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["TiDB Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/30b83b28a4ab.html"}},{"event_id":"0715f0d3b7c0","title":"Plaid 从 Aurora 迁移到分布式 SQL 的零停机实践","summary":"Plaid 的 Amazon Aurora MySQL 集群面临大版本升级时，评估需要耗费六个工程月并伴随数十分钟停机。为支撑数千个金融应用的 API，Plaid 转而迁移至分布式 SQL，首次在 TiDB 上升级即覆盖六个生产集群、一周内完成且零停机。文章分析了金融科技在高并发、实时分析与一致性审计下面临的架构挑战，以及分布式 SQL 如何应对。","why_it_matters":"面向金融科技高并发与零停机诉求，给出分布式 SQL 迁移的真实生产案例与架构权衡，对数据库选型和升级策略有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析","湖仓"],"vendors":["PingCAP","TiDB","Plaid","Amazon Aurora"],"importance":67,"heat":40,"pinned":false,"published_at":"2026-09-26T16:31:01+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["TiDB Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/0715f0d3b7c0.html"}},{"event_id":"9c8c6dfffbeb","title":"Power Pages 现代列表功能正式发布","summary":"微软宣布 Power Pages 中的现代列表（Modern List）正式可用，采用 Fluent UI 组件展示 Dataverse 数据，支持无限滚动、内联筛选、微光加载、低代码定制及自定义 JavaScript。正式发布后，新建 Power Pages 站点默认使用现代列表，经典列表保持不变以便组织按自身节奏迁移。本次还通过 Power Pages 客户端 API 开放自定义 JavaScript 支持，开发者可读取行列数据、响应加载与选中事件并自定义样式。","why_it_matters":"Power Pages 是微软低代码数据呈现入口，此次将现代列表设为默认并开放客户端 API，对使用 Dataverse 做业务应用与报表搭建的数据从业者有直接参考价值。","category":{"slug":"bi","label":"BI 与可视化"},"topics":[],"vendors":["Microsoft","Power BI","Power Pages","Dataverse"],"importance":66,"heat":33,"pinned":false,"published_at":"2026-09-23T14:50:12+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Microsoft Power BI（Power Platform Blog）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/9c8c6dfffbeb.html"}},{"event_id":"93d95b246d70","title":"Vercel 与 TiDB Cloud Starter：AI 应用全栈实战指南","summary":"文章介绍在 Vercel 上构建 AI 应用时如何选择适配 Serverless 与边缘运行时的数据库。TiDB Cloud Starter 通过 HTTPS 连接替代 TCP 连接池，支持 MySQL 协议、秒级开通，并提供原生 VECTOR 类型把向量嵌入与业务数据存于同一行。从 v0.dev 默认数据库迁移到 TiDB 只需改连接串，Vercel Marketplace 集成可自动写入连接变量。","why_it_matters":"面向 AI 应用开发者，讲清了边缘运行时下数据库连接模型的变化与向量数据存储方案，对选型和落地有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["Data Agent"],"vendors":["PingCAP","TiDB","Vercel"],"importance":66,"heat":36,"pinned":false,"published_at":"2026-09-25T04:52:55+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["TiDB Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/93d95b246d70.html"}},{"event_id":"9013c2752aa4","title":"在 Amazon SageMaker Catalog 中用生成式 AI 查询非结构化数据","summary":"这是系列文章第二部分，介绍非结构化数据消费侧流程。数据消费者登录 SageMaker Unified Studio，利用 AI 生成元数据关键词在 Amazon SageMaker Catalog 中搜索并订阅 S3 数据资产，经生产者审批后使用两种方式查询：面向分析师和业务用户的无代码聊天 Agent 自然语言查询，以及面向应用工程师的 Amazon Bedrock 模型推理编程访问。生产侧此前使用 Amazon Textract 和 Amazon Bedrock 上的 Anthropic Claude 提取并丰富元数据，目标是让组织更易发现并利用 PDF、图像、邮件等非结构化数据中的业务知识。","why_it_matters":"数据从业者可了解如何把数据目录、元数据增强、订阅审批与生成式 AI 查询串成可落地的非结构化数据消费链路，覆盖从业务分析到应用集成的两种模式。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化","Data Agent"],"vendors":["AWS","Amazon SageMaker","Amazon Bedrock","Anthropic"],"importance":66,"heat":34,"pinned":false,"published_at":"2026-09-24T02:22:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/9013c2752aa4.html"}},{"event_id":"069c882cd495","title":"Amazon EMR on EC2 支持 Spark Connect：本地 IDE 交互式调试 PySpark","summary":"AWS 宣布在 Amazon EMR on EC2 上支持 Spark Connect，基于 emr-spark-8.0（Apache Spark 4.0.2 及以上）运行时。开发者可在 SageMaker Unified Studio Data Notebooks 或 VS Code、PyCharm、Kiro、Jupyter 等本地 IDE 中交互式开发和调试 PySpark：Python 在本地运行，计算在 EMR 集群上执行，可直接对全量数据打断点、查看 DataFrame。Spark Connect 采用客户端-服务端架构，通过 gRPC/TLS 把 DataFrame 与 SQL 操作发送到集群端 Spark Connect Server，本地无需安装 Spark 也无需按负载配置机器。每个会话拥有独立权限，因此团队可共享同一集群并行工作。","why_it_matters":"这是 Spark 交互式开发模式的实质性变化，把本地调试体验与集群真实引擎统一，直接关系到数据工程团队在 EMR 上的开发效率和集群共享治理方式。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["数据人"],"vendors":["AWS","Amazon EMR","Amazon SageMaker","Apache Spark"],"importance":65,"heat":33,"pinned":false,"published_at":"2026-09-24T02:28:32+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["AWS Big Data Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/069c882cd495.html"}},{"event_id":"813afb685929","title":"ClickHouse 26.9 发布：条件 LIMIT 与物化视图增量刷新","summary":"ClickHouse 发布 26.9 版本，包含 56 项新功能、135 项性能优化和 464 个缺陷修复。该版本引入 LIMIT 条件边界、面向 append-only 物化视图的增量刷新，以及高基数 DISTINCT 查询的磁盘溢写。还新增时间受限访问令牌，并加快 min、max、count 查询，扩展 PromQL 支持。","why_it_matters":"ClickHouse 是实时分析数据库，本版本的功能与性能改进直接影响查询能力、运维成本和权限控制，数据平台与实时分析从业者可评估升级收益。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析"],"vendors":["ClickHouse"],"importance":63,"heat":32,"pinned":false,"published_at":"2026-09-23T08:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["ClickHouse Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/813afb685929.html"}},{"event_id":"472befb4e81f","title":"Snowflake零拷贝交互式分析加速事件表查询","summary":"Snowflake 推出 Zero-Copy Interactive Analytics，允许交互式仓库直接查询任意表，包括存放 OpenTelemetry 日志、指标与链路的事件表。此前用交互式仓库查询事件表数据需要中间交互表，会引入第二份遥测数据副本和刷新流程，现在该中间层被移除。事件表数据量可达数十亿行，但可观测性查询往往只需少量切片且重复、对延迟敏感，该能力针对这一模式优化。","why_it_matters":"对使用 Snowflake 做可观测性数据存储与分析的团队，该功能减少数据副本和 ETL 刷新，值得关注其对查询延迟和架构的影响。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析"],"vendors":["Snowflake"],"importance":61,"heat":31,"pinned":false,"published_at":"2026-09-23T22:01:05+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/472befb4e81f.html"}},{"event_id":"e399ff029741","title":"Unity Gateway CLI：规模化部署与管理编码Agent","summary":"在模型快速迭代、约每五天出现新前沿模型的背景下，Unity Gateway 推出 CLI，让管理员集中配置编码 Agent 的默认模型、MCP servers、skills、Smart Routing 和支出策略。开发者可用 ug claude 或 ug codex 等命令启动获批 Agent，CLI 负责认证并应用已发布设置。该方案旨在统一跨多家模型供应商的访问、预算、安全策略和使用日志，并支持一次性向所有支持的 Agent 推行新模型或工作流。","why_it_matters":"它把多模型、多编码 Agent 的接入、权限、预算与配置集中治理，对需要内部部署和管理 AI Agent 的数据平台团队有直接参考价值。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["平台AI化"],"vendors":["Databricks"],"importance":60,"heat":33,"pinned":false,"published_at":"2026-09-25T00:46:05+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/e399ff029741.html"}},{"event_id":"1cb887e7a170","title":"ClickHouse任命前Snowflake CFO进入董事会","summary":"ClickHouse 宣布任命 Michael Scarpelli 为董事会独立董事，并将担任审计委员会主席。他曾任 Snowflake CFO，也曾在 ServiceNow 和 Data Domain 担任 CFO 并主导 IPO。ClickHouse 称其年化收入已超 3.5 亿美元，较 2025 年底约 2 亿美元增长；客户超 4000 家，包括 DoorDash、Ramp、Meta、Tesla、Cisco 和 Visa。公司今年 Series D 估值 150 亿美元，员工近 800 人，计划年底达 1000 人，超一半收入来自美国以外。","why_it_matters":"这是实时分析数据库厂商 ClickHouse 的增长与企业化治理信号，前 Snowflake CFO 加入强化其 IPO 预期，反映数据基础设施厂商竞争与商业化进展。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["实时分析"],"vendors":["ClickHouse","Snowflake"],"importance":59,"heat":30,"pinned":false,"published_at":"2026-09-23T04:32:35+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["ClickHouse Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/1cb887e7a170.html"}},{"event_id":"113da8bd65f9","title":"Snowflake PERIOD 数据类型：用原生时间范围查询生效记录","summary":"Snowflake 的 PERIOD 数据类型把时间范围的起止边界存为一个带类型的值，并已正式可用（GA）。其 SQL 函数可判断某日期是否落在范围内、两个范围是否重叠以及重叠部分。文章用三个场景演示：生效日期查找、历史关联查询和车队工时统计。PERIOD 采用左闭右开约定，[2026-01-01, 2026-04-01) 含 1 月 1 日但不含 4 月 1 日，且边界必须有限、起点须早于终点。","why_it_matters":"对做数仓建模与历史数据关联的数据从业者，PERIOD 提供了一种比传统 start/end 双列更简洁的时间有效性表达方式，能减少每条查询重复实现区间规则的负担，值得评估是否纳入现有效果/缓慢变化维方案。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["Snowflake"],"importance":59,"heat":29,"pinned":false,"published_at":"2026-09-22T22:01:07+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Snowflake Engineering（Medium）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/113da8bd65f9.html"}},{"event_id":"c2ec32b4904f","title":"演讲：真实世界中的自适应推荐系统——推理、评估与系统设计","summary":"Mallika Rao 在演讲中指出，自适应推荐系统的真正复杂度并不在模型架构，而在于系统本身。她讨论了实时反馈循环、检索新鲜度、多阶段编排与端到端延迟预算，说明这些机制如何让系统在生产环境中持续学习与演进。她认为推荐系统多年来积累的经验——反馈循环、评估、在线学习、不确定性下运营——正随着 AI 变得更具自适应性而具有更广泛的适用性。","why_it_matters":"推荐系统的工程经验（反馈循环、检索新鲜度、编排与延迟预算、评估）正被迁移到 Data Agent 与 AI 数据平台的生产落地中，对关注系统可靠性和成本性能的数据从业者有直接参考价值。","category":{"slug":"insight","label":"AI分析"},"topics":["Data Agent"],"vendors":[],"importance":57,"heat":36,"pinned":false,"published_at":"2026-09-26T19:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/c2ec32b4904f.html"}},{"event_id":"0c45b872e223","title":"Databricks发布Unity Catalog Pages治理知识层","summary":"Databricks 推出 Unity Catalog Pages，作为 Genie Ontology 中由人工策展的治理层，为人和 AI 智能体提供业务概念定义。Genie Ontology 会自动从仪表板、查询、表和管道中提取知识，组织成图谱来指导智能体查找和信任数据。Pages 让数据管家借助 Genie Code 明确定义“已完成行程”“活跃客户”等关键概念的权威含义，并让 Genie 将其作为事实来源。这旨在解决企业术语分散、同一指标多种定义导致智能体自信猜测的问题。","why_it_matters":"数据从业者应关注语义层如何从自动推断扩展到人工治理，以及 Unity Catalog 在 AI Agent 上下文和指标一致性上的产品化路径。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["语义层","Data Agent"],"vendors":["Databricks"],"importance":57,"heat":28,"pinned":false,"published_at":"2026-09-22T21:57:06+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/0c45b872e223.html"}},{"event_id":"d2044403b905","title":"Fivetran 与 Airbyte 对比：功能、定价与关键差异","summary":"文章对比了 Fivetran 与 Airbyte 两款数据集成平台的功能与定价，帮助读者选择合适的数据集成方案。Airbyte 是 2020 年成立的开源 ELT 引擎，提供自托管 Core、云版 Cloud 以及混合部署的 Enterprise Flex 三种形态；Fivetran 是 2012 年成立的全托管数据移动平台。截至 2026 年 9 月，Fivetran 覆盖 700+ 数据源，Airbyte 为 600+ 数据源（云版约 550 个），两者均支持全量、列级与基于 CDC 的增量复制。","why_it_matters":"数据集成是数仓与湖仓建设的关键环节，本篇对两大主流 ELT 工具在连接器数量、部署形态与复制能力上的横向对比，可作为技术选型的参考依据。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["Fivetran","Airbyte"],"importance":56,"heat":33,"pinned":false,"published_at":"2026-09-25T23:55:22+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Fivetran Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/d2044403b905.html"}},{"event_id":"28ca9aa596a8","title":"QCon AI纽约2026议题公布：Agent授权与AI生产评估","summary":"QCon AI New York 2026已确认30余场议题中的23场，涵盖自主Agent的身份与授权、大规模Kubernetes运维Agent的护栏机制、共享模型推理平台，以及AI决策系统上线后的评估。大会定于2026年12月15-16日在新泽西城Westin Jersey City Newport举行，面向在生产环境构建AI系统的资深工程师、架构师与技术负责人。大会主席Hien Luu指出，AI工程正在变成系统工程，工程挑战从模型行为转向系统行为，需要给Agent设定有边界的执行权限、管理上下文与状态，并用确定性控制面封装概率模型；工程实践日益融合分布式系统、安全、平台工程与SRE。","why_it_matters":"议题聚焦Agent生产落地中的授权、护栏、共享推理与上线后评估，正是Data Agent从Demo走向生产必须解决的控制面与评测问题，对构建企业级数据分析Agent的团队有直接参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent"],"vendors":[],"importance":56,"heat":33,"pinned":false,"published_at":"2026-09-25T19:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/28ca9aa596a8.html"}},{"event_id":"83dc1ec6a191","title":"Google Cloud为托管Spark引入灵活虚拟机以应对容量短缺","summary":"Google Cloud博客介绍其托管Apache Spark服务中的灵活虚拟机（Flexible VMs）功能，用于缓解AI算力需求激增导致的容量短缺问题。灵活虚拟机不再将集群绑定到单一实例类型，而是允许为master、主worker和次级worker节点配置有序的可接受机型列表，支持N2/N2D等Gen2与N4/C4等Gen4机型混用，并支持混合存储。该机制通过排序配置自动尝试供给，降低区域或可用区容量售罄导致的集群创建延迟与执行失败风险。","why_it_matters":"对自建或托管Spark数据管道的数据团队而言，容量售罄是影响SLA的现实问题，该文给出了通过多机型排序与混合存储提升集群可用性的具体配置思路。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["湖仓"],"vendors":["Google","Google Cloud"],"importance":55,"heat":26,"pinned":false,"published_at":"2026-09-21T08:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Google Cloud Data Analytics Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/83dc1ec6a191.html"}},{"event_id":"4ce08dbfa3a3","title":"爱分析访谈海致科技：Harness工程是AI可控的关键一环","summary":"爱分析与海致科技联合创始人杨娟围绕Harness工程展开访谈，讨论其如何从Prompt、Context扩展到Skill管理与任务调度，成为支撑企业AI可解释、可追溯、高可信落地的系统工程。海致科技将图数据库、图模融合平台与Harness能力结合，用高性能图计算重构task、skill、审计等环节，并强调企业客户更关注结果稳定、过程可验证和责任可追溯。文章还讨论了图智能的新一轮爆发，以及从RAG走向可验证推理、企业Ontology从分析走向执行等方向。","why_it_matters":"文章对Data Agent与企业AI平台建设者理解可控性工程、图模融合和Ontology落地有参考价值，尤其适合关注AI进入核心业务后的可靠性与审计问题。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["Data Agent","平台AI化"],"vendors":["海致科技"],"importance":53,"heat":35,"pinned":false,"published_at":null,"discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["爱分析"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/4ce08dbfa3a3.html"}},{"event_id":"ac77d8cab004","title":"Databricks Genie One MCP 正式开放","summary":"Databricks 宣布 Genie One Model Context Protocol（MCP）服务器已面向所有用户正式可用（GA）。该 MCP 以托管服务形式运行在 Unity Gateway 中，向任意 Agent 提供统一接口，用于检索结构化与非结构化数据、洞察与答案，并基于 Genie Ontology 的受治理业务上下文。它暴露提问、获取查询结果、查看增量进度、调整回答等工具，MCP App 还能在支持的客户端中嵌入可视化与 Genie Ontology 引用。客户 GetYourGuide 表示，该集成让团队在 Genie One UI、Claude Cowork 或 IDE 中获得一致的受治理答案。","why_it_matters":"这是把语义层/业务本体通过 MCP 暴露给任意 Agent 的正式产品能力，直接关系 Data Agent 的可扩展性与答案一致性，对做 ChatBI、Agent 平台和数据治理的团队有参考价值。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent","语义层"],"vendors":["Databricks"],"importance":52,"heat":26,"pinned":false,"published_at":"2026-09-23T00:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/ac77d8cab004.html"}},{"event_id":"999778ff0658","title":"Genie One MCP：为任意AI Agent提供业务上下文","summary":"Genie One MCP 为任何兼容 MCP 的 AI Agent 提供受治理的业务上下文，可连接 ChatGPT、Claude、Microsoft Copilot 和编码 Agent 等。它把净销售额、活跃促销、准时等指标定义、可信数据关系和权限控制集中到 Genie Ontology 中，让 Agent 不必从原始表或冗长提示中推断含义。文章指出通用 Agent 面临事实分散、语义不一致、权威来源与血缘缺失三类问题，例如回答“最大客户上周净收入为何下降8%”需跨销售、财务、促销、库存和客户数据。通过这些上下文，Agent 能使用经批准的定义、可信关系和权限感知访问来回答业务问题。","why_it_matters":"关注 MCP 如何把语义定义、数据关系和权限治理接入通用 AI Agent，这正是企业让 Agent 可靠回答业务问题的关键上下文层。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["语义层","Data Agent"],"vendors":["Databricks","Genie One"],"importance":50,"heat":25,"pinned":false,"published_at":"2026-09-23T00:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Databricks Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/999778ff0658.html"}},{"event_id":"568acdafe73a","title":"ThoughtSpot 推出 Live Data 电子表格","summary":"ThoughtSpot 发布 Spreadsheets on Live Data，将电子表格界面嵌入 ThoughtSpot，让分析师直接在实时、受治理的数据上查看、修改和保存工作。它支持实时更新数字，并可共享成果或直接发布到数仓。ThoughtSpot 指出现有 Excel 导出流程会产生大量脱离治理的文件，使业务和 AI Agent 难以依赖这些数据。","why_it_matters":"该发布针对 BI 自助分析中的核心治理痛点：保留电子表格体验的同时，避免数据导出后失去权限、口径和可追溯性。对关注 BI 治理、自助分析和 AI 就绪数据的数据从业者有参考价值。","category":{"slug":"bi","label":"BI 与可视化"},"topics":["BI变局"],"vendors":["ThoughtSpot"],"importance":50,"heat":29,"pinned":false,"published_at":"2026-09-25T06:44:22+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["ThoughtSpot Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/568acdafe73a.html"}},{"event_id":"951b7e33e52c","title":"dbt：在数据仓库中开始上下文工程","summary":"文章提出，分析团队过去为 BI 建模数据，而上下文工程是为 AI Agent 建模数据，起点是语义搜索。AI Agent 正成为最大数据用户，其所需上下文不再局限于结构化表，还包括转录、工单、PDF 和邮件。团队可复用 dbt 的工程模式：转换数据、关联富化、描述字段含义并治理访问权限；栈仍是 Fivetran 入仓、dbt 建模。仓库厂商正加大对非结构化数据的投入，文末还介绍了 dbt_context_engineering 包和一场相关 session。","why_it_matters":"数据从业者可借此理解从 BI 建模到为 Agent 准备上下文的范式变化，并看到 dbt/Fivetran/数仓栈在语义、治理和非结构化数据上的落地路径。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["Data Agent","语义层"],"vendors":["dbt Labs","Fivetran"],"importance":48,"heat":27,"pinned":false,"published_at":"2026-09-24T23:57:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["dbt Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/951b7e33e52c.html"}},{"event_id":"f2cae75df487","title":"AI智能体的上下文问题：语义层采购前先解决治理与定义","summary":"文章指出，多数AI Agent能写SQL，但常基于错误的收入定义、错误团队和错误业务规则，演示中很难发现。语义层市场拥挤，各大分析厂商、数据平台和BI工具都宣称有语义层，但技术可信度取决于采购前的治理与定义决策。作者建议在评估语义层厂商前先确认治理机制，锁定核心指标、KPI和术语定义，并要求厂商在自身技术栈中压力测试核心能力。","why_it_matters":"对负责语义层、ChatBI/Data Agent选型的数据从业者，这篇文章指出AI分析失败常源于上下文与指标定义治理，而非模型能力，并给出采购前评估框架。","category":{"slug":"platform","label":"AI 数据平台"},"topics":["语义层","Data Agent"],"vendors":["ThoughtSpot"],"importance":46,"heat":25,"pinned":false,"published_at":"2026-09-24T01:09:35+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["ThoughtSpot Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/f2cae75df487.html"}},{"event_id":"5b8b1678d7ac","title":"InfoQ推出高效能团队认证项目","summary":"InfoQ 开放首期\"InfoQ认证高效能团队项目\"报名，为期五周的线上直播课程，由 InfoQ Java 编辑兼播客联合主持人 Olimpiu Pop 主讲。课程自2026年11月17日持续至12月17日，每周二、周四16:00-18:00（中欧时间）上课，报名费1470美元。内容涵盖工程团队结构、交付流、归属感、AI赋能工作与度量指标之间的关系，学员将在五周内为工程团队制定目标运营模型。","why_it_matters":"该内容为软件工程团队管理与AI赋能交付的培训课程，不涉及数据仓库、BI、数据平台或数据分析等本站覆盖领域。","category":{"slug":"product","label":"数据产品"},"topics":[],"vendors":[],"importance":45,"heat":26,"pinned":false,"published_at":"2026-09-24T23:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/5b8b1678d7ac.html"}},{"event_id":"4509822decea","title":"从仪表盘到AI Agent：Huel的分析转型之路","summary":"Huel 数据团队从已建成的现代数据栈和自助式仪表盘，转向 AI 驱动的 agentic analytics，并重新定义数据团队角色。ThoughtSpot 的 Jane Smith 与作者在伦敦 CDO Retail Exchange 上围绕 The Power of Trust + Context for Agentic Analytics 对谈。Huel 曾尝试在 Snowflake 中建模并通过 Claude 提供给员工，但发现通用 LLM 更像缺乏透明度的中间人，因此强调可解释性与商业化优先。文中还提到 Spotter 在 Huel 场景中的作用。","why_it_matters":"对数据从业者，这是一份消费品牌如何从自助 BI 迈向 AI/Agent 分析的一线经验，尤其适合关注通用 LLM 在信任、上下文与可解释性上的边界。","category":{"slug":"agent","label":"Data Agent"},"topics":["Data Agent","BI变局"],"vendors":["ThoughtSpot","Snowflake"],"importance":40,"heat":20,"pinned":false,"published_at":"2026-09-22T06:13:02+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["ThoughtSpot Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/4509822decea.html"}},{"event_id":"b94c6c9a09dd","title":"13个员工留存策略：留住顶尖人才","summary":"Visier 发布文章，提出 13 个员工留存策略，帮助企业在 AI 重塑技能需求、工作负荷加重和重组频繁的背景下留住核心人才。文章指出，员工流失会带来招聘、入职和培训成本上升，并导致技能与组织知识流失；Visier 研究显示，37% 的领导者已将流失带来的招聘和培训成本视为劳动力规划不佳的主要后果。企业可通过劳动力数据识别留存风险，并衡量留存措施是否有效。","why_it_matters":"虽然主题是人力资源，但来自 people analytics 厂商 Visier，涉及用劳动力数据识别留存风险，对关注组织人才分析的数据从业者有参考价值。","category":{"slug":"insight","label":"AI分析"},"topics":["组织人才"],"vendors":["Visier"],"importance":35,"heat":22,"pinned":false,"published_at":"2026-09-25T08:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["Visier Blog"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/b94c6c9a09dd.html"}},{"event_id":"03f002538afd","title":"播客：AI的未来——从企业采纳到开源主权","summary":"这是一期InfoQ播客的文字记录，主持人与DoubleWord联合创始人Meryem Arik、BBVA负责任AI负责人Clara Higuera Cabañes及Jeff Smith讨论企业AI现状。内容涉及企业为何急于采纳AI以保持竞争优势、开源模型与推理成本（tokenomics）、以及负责任AI原则如何落地为银行产品，属于泛AI与企业AI采纳话题。","why_it_matters":"内容为泛AI采纳与开源模型的播客讨论，未直接涉及Data Agent、数据平台、BI或具体数据分析业务问题，与本站五个垂直领域无直接关联。","category":{"slug":"product","label":"数据产品"},"topics":[],"vendors":["DoubleWord","BBVA"],"importance":30,"heat":21,"pinned":false,"published_at":"2026-09-25T19:00:00+08:00","discovered_at":"2026-09-26T22:27:28.257662+08:00","sources":{"count":1,"names":["InfoQ（AI/数据工程）"]},"push":{"recommended":false,"reason":null},"links":{"detail":"https://datahot.xiahongbin.com/e/03f002538afd.html"}}]}
