下拉刷新

今日热榜

完整榜单 →

时间轴

(524)
今天 · 9月30日星期三 · 3 个事件
RSSAWS Big Data Blog6 小时前 TOP 3 69

为 Amazon MWAA 构建 LLM 驱动的 DAG 故障分析插件

Apache Airflow 已成为数据管道编排核心,但当管道扩展到数百个 DAG 并跨 AWS Glue、Amazon EMR、Amazon Athena、Amazon Redshift 等服务时,单个任务失败排查非常耗时。本文介绍如何构建自定义 Airflow 插件,集成 Amazon Bedrock(Anthropic Claude)自动分析 DAG 任务失败,并给出可操作的诊断洞察。插件部署在 Amazon MWAA 上,在 Airflow UI 中提供按需 AI 根因分析。完整源码已发布在 GitHub 示例仓库中。

推荐理由:数据从业者可了解如何用 LLM 增强数据管道可观测性与故障排查,降低 SLA 风险与数据工程运维负担。
平台AI化AWSAmazon MWAAAmazon Bedrock
RSSAWS Big Data Blog6 小时前 59

AWS 在 Amazon EMR on EKS 上支持 Spark Connect

AWS 宣布在 Amazon EMR on EKS 上支持 Spark Connect,起始版本为 EMR 7.14(Apache Spark 3.5.8)与 emr-spark-8.1(Apache Spark 4.1.1)。开发者可在 VS Code、PyCharm、Jupyter、SageMaker Unified Studio 等本地工具中构建、测试和调试 PySpark 应用,实际计算则路由到 EKS 上的 Spark 集群执行。该能力基于客户端-服务端架构,通过 gRPC/TLS 连接,旨在解决本地环境与远程集群之间的依赖冲突和规模性能差异。每个 Spark Connect 会话可使用独立的 IAM 执行角色与自定义标签,便于权限隔离和成本追踪,AWS 还提供了端到端示例 notebook。

推荐理由:Spark Connect 把交互式开发与 EKS 上弹性 Spark 计算解耦,是数据平台在湖仓处理与开发体验上的基础设施级变化,影响 CI/CD 数据质量测试、Notebook 交互开发等工程实践。
湖仓AWSAmazon EMRAmazon EKSAmazon SageMaker
RSSAWS Big Data Blog6 小时前 65

Aurora PostgreSQL 与 SageMaker zero-ETL 集成

AWS 推出 Amazon Aurora PostgreSQL 与 Amazon SageMaker 的 zero-ETL 集成,将 Aurora PostgreSQL 数据近实时复制到 AWS Glue Data Catalog,并以 Apache Iceberg 表形式提供分析访问。该集成基于 CDC,通过增强逻辑复制捕获事务日志中的插入、更新和删除,减少传统 ETL 管道的延迟、运维开销与数据孤岛。用户可在 SageMaker 中结合 S3 数据湖和 Redshift 数仓的数据,用 SQL、Spark、BI 及 AI/ML 工具分析同一份数据。文章还介绍了 Lake Formation 的统一访问控制、湖仓架构和配置查询流程。

推荐理由:数据从业者可了解 AWS 在湖仓与零 ETL 方向的产品化路径,以及基于 CDC/逻辑复制的近实时数据接入机制,对评估数据集成架构和治理有参考价值。
湖仓实时分析AWSAmazon AuroraAmazon SageMakerAWS GlueAmazon Redshift
9月29日星期二 · 9 个事件
RSSSnowflake Engineering (Medium)8 小时前 TOP 1 72

Snowflake交互式数仓上的一体化AI应用与可观测性

作者在单个 Snowflake Interactive Warehouse 上同时构建零售运营 AI 应用和其可观测性管线。Cortex Agents 基于 Semantic View 生成 Text-to-SQL,查询约 2500 万行销售数据;AI Observability 自动将 trace、span、工具调用和 token 数写入 SNOWFLAKE.LOCAL.AI_OBSERVABILITY_EVENTS,无需 SDK 或 collector。监控看板与 Agent 共用同一仓库,最终发现了一个被 Agent 100% 成功率掩盖的语义视图缺陷。完整 SQL、代码和 Streamlit 应用已发布在 GitHub。

推荐理由:对想落地 Data Agent 并解决其可观测性、语义一致性与评估问题的数据团队有直接参考价值;也展示了 Snowflake 交互式数仓、Cortex Agents 与 AI Observability 的一体化实践。
RSSDatabricks Blog周二 04:04 62

Lakebase Search:为 Postgres 带来全文与向量搜索

Lakebase 为 Postgres 推出 Lakebase Search,包含 lakebase_vector(可扩展近似邻居搜索)和 lakebase_text(BM25 全文搜索)两个扩展,现已在 AWS 和 Azure 正式可用。官方称在 VectorDBBench 100M 基准上,lakebase_vector 吞吐量达到次优系统的 2 倍,成本仅为使用 pgvector 的云 Postgres 厂商的 1/4。其测试显示在 100M LAION 数据集上,97% recall 时 P99 延迟为 71 毫秒。客户 Conexiom 使用 BM25 混合搜索处理超 1 亿行数据,计算资源仅为此前 pgvector 方案的一半。

推荐理由:Lakebase 把向量与 BM25 全文搜索直接放进 Postgres,瞄准 AI Agent 的低延迟、高准确检索需求,并给出吞吐、成本、延迟与召回率数据。数据平台从业者可据此评估是否仍需外挂独立搜索/向量数据库,以及 pgvector 在规模化后的替代路径。
Data AgentDatabricksLakebase
RSSDuckDB Engineering Blog22 小时前 59

Jev与DuckDB:在SQL中用自然语言条件

TypeSafe AI于2026年9月15日发布Jev模型,它返回带概率的类型化答案而非文本段落,支持是/否、选项和评分三类问题。发布一周内,社区为DuckDB开发了扩展,可用自然语言条件对CSV、Parquet或表进行过滤、分类和打分,约1000行数据耗时约10秒。Jev报告端到端延迟70-500毫秒,输入token价格0.042美元/百万。文章介绍了Jev的机制、DuckDB扩展的工作方式及相关讨论。

推荐理由:把LLM式语义判断以类型化、可SQL集成的形式落地到DuckDB分析流程,为数据从业者提供了在数仓内做文本分类和过滤的新路径,并涉及成本、延迟与准确性的工程权衡。
平台AI化ChatBIDuckDBTypeSafe AI
RSSClickHouse Blog15 小时前 63

ClickHouse Fabric 工作负载公测:OneLake 亚秒级分析

ClickHouse Workload for Microsoft Fabric 现已公开预览,可从 Fabric 工作负载中心获取,把 ClickHouse 作为 OneLake 的加速层。用户可将 OneLake 表同步到专属 ClickHouse Cloud 服务,在 Fabric 内以亚秒级响应查询数十亿行,且 OneLake 保持唯一事实源。该工作负载使用 Microsoft Entra 账户在 Azure 上开通专属 ClickHouse Cloud 计算,含试用,可服务 AI agent、仪表盘和应用而不消耗 Fabric 容量。它还提供内嵌 SQL 控制台、Power BI 认证连接器、Fabric notebook 及面向 Copilot Studio/GitHub Copilot 的只读治理访问。

另有 2 家信源报道:ClickHouse Blog · ClickHouse Blog
推荐理由:数据从业者可关注 OneLake 上亚秒级、高并发查询能力,以及 Fabric 内引入 ClickHouse 加速 AI agent 与看板负载、避免自建缓存和 ETL 的方案。
湖仓实时分析ClickHouseMicrosoft FabricPower BI
RSSGoogle BigQuery Release Notes15 小时前 TOP 2 70

BigQuery支持Gemini 3.1 Flash Lite与3.5 Flash GA模型

BigQuery宣布正式支持gemini-3.1-flash-lite和gemini-3.5-flash GA模型,适用于us、eu及global多区域端点。用户可在所有生成式AI函数中使用这些模型。该更新源自BigQuery官方发布说明。

另有 24 家信源报道:Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes · Google BigQuery Release Notes
推荐理由:数据从业者可在BigQuery内直接调用最新Gemini模型进行生成式分析,降低AI功能集成成本。
平台AI化GoogleBigQueryGoogle Cloud
RSSInfoQ 中文周二 06:17 58

Cloudflare推出智能体开发生命周期,取代传统SDLC

Cloudflare提出智能体开发生命周期,用自动化软件工厂替代传统软件开发生命周期,通过Workflows编排层与@cloudflare/ci工具链支持智能体自主完成开发、测试、部署和自我改进。平台强调可编程、水平扩展、事件驱动,为每个智能体创建预览部署并并行测试生产环境,同时提供OpenTelemetry兼容的可观测性与基于短期凭证的智能体访问模型。

推荐理由:Cloudflare将Agent工作流、可观测性和访问控制组合成面向AI工程的基础设施,对关注Agent平台化、CI/CD演进和生产评估的数据与AI平台从业者有参考价值。
RSSDatabricks Blog周二 04:11 66

Databricks 如何让1.4万员工首日接入前沿模型

Databricks 官方博客介绍其让上万名员工在新模型发布首日即可试用前沿模型的机制,核心依托 Unity Gateway 进行自适应发布、评估与成本控制。文中披露:被宣传为前沿的模型未必更好,如 Opus 5.0 成本更高且工程师质量评分低于 Opus 4.8。无成本约束地开放 GPT Astra 时,开发者平均支出增加 60%,因此采用按用户预算限制与用量引导。在 Opus 5、GPT-6 Sol 与 GPT-Luna 密集发布的当周,Databricks 全员首日接入,第 3 天即用数据确认其处于效率前沿并纳入基础设施。

另有 1 家信源报道:Databricks Blog
推荐理由:这是一份难得的超大规模企业内部 AI 模型接入与治理第一手实践,涉及模型评估、成本控制与灰度发布,对正在建设模型网关与 AI 平台治理的数据团队有直接参考价值。
平台AI化Databricks
RSSDatabricks Blog周二 00:30 52

Genie One 企业级推广分步 playbook

区域销售总监想了解东北 pipeline 本季走弱的原因,却要等懂可信数据的分析师到周四,最终只能在缺少答案的情况下决策。Genie One 旨在让业务人员用自然语言提问,获得基于受治理数据并引用来源的回答,并快速启动后续多步工作。原文认为,AI 推广停滞常因一次性铺开过多数据域、不同团队对“活跃客户”定义不一、语义层无人负责且缺乏答案校验机制。其落地 playbook 建议从窄问题集开始,先赢得早期采用者信任,再依据反馈逐步扩展到更多业务线,并包含 Genie One、领域特定 Genie Agents、Genie Ontology 等组件。

推荐理由:对数据从业者而言,这是一份 Data Agent/ChatBI 在企业内推广的序列化方法:先解决语义一致、来源引用和答案校验,再通过早期采用者扩展到业务线,对减少 AI 分析工具落地失败有参考价值。
RSSDatabricks Blog周二 03:47 45

制造业数据与AI:连接产品价值链

文章指出制造缺陷往往跨越机器设置、供应商批次、物流事件和质量系统,相关数据被分割在工厂、职能和系统边界中。它回顾了50多年前Joseph Harrington提出的计算机集成制造(CIM)愿景,并认为现代数据与AI平台正让连接产品价值链变得可行。核心跨阶段问题包括:受影响产品涉及哪些供应商批次、缺陷是否曾出现及纠正措施是否有效、哪些客户或服务案例可能受影响。文章强调制造商需要的是带治理和业务上下文的跨系统信息流,而不是更多孤立报表。

推荐理由:制造数据跨系统集成与AI平台落地是典型行业场景,涉及数据接入、治理和业务上下文,能帮助数据从业者理解制造价值链的数据架构与决策问题。
9月28日星期一 · 8 个事件
RSSClickHouse Blog周一 17:42 53

chDB 为 Agent 记忆提供持久化层

chDB 是 ClickHouse 驱动的嵌入式 SQL OLAP 引擎。团队曾用 chDB 在单台笔记本上为 coding agent 保存项目规则、用户偏好、决策、原始转录和召回轨迹,运行数周后却无法把状态带到 CI、可能一小时即消失的沙箱或第二台笔记本。改用 ClickHouse server 后端虽可移植,但会把本地 recall 变成带凭据、连接管理和远程延迟的网络查询。chDB Durable Layer 试图把可恢复的分析状态存入自有对象存储,同时保留本地查询速度。

推荐理由:对构建 Data Agent/分析 Agent 的团队有参考价值:它具体讨论 Agent 记忆在本地嵌入式 OLAP、对象存储持久化与远程服务之间的工程权衡,而非停留在概念层。
Data AgentClickHousechDB
官网Snowflake Release Notes收录 09-28 58

Snowflake 10.29 发布:按用户配额正式可用

Snowflake 发布 10.29 版本说明,按用户配额正式可用,可为账户内单个用户设置月度与日度信用额度,并按阈值通知。配额覆盖仓库计算与 AI 功能域,包括 AI Functions、Snowflake CoCo、Cortex Agents 和 Snowflake CoWork,并可自动阻止超限用户访问 AI。正式版更新包括阻止通知开关、按月度或日度限额定阈值、QUOTA_ACCESS_BLOCK_HISTORY 视图,以及配置传播时间约 5–10 分钟。

推荐理由:Snowflake 用户应关注按用户配额正式可用及其对 AI 功能访问控制的影响,这关系到成本治理、权限管理和 AI 平台运营。
平台AI化Snowflake
RSSAWS Big Data Blog周一 23:48 53

Redshift Iceberg 写入支持 Part 3:模式与分区演进

AWS 官方博客 Part 3 以客户和订单数据集为例,演示如何通过 ALTER 操作演进 Amazon Redshift 中的 Apache Iceberg 表模式与分区布局。操作包括重命名/新增/删除列、扩展列类型、设置表属性,以及新增/删除/替换分区字段,这些变更均为元数据操作,无需重写数据或重建管道。文章还介绍在 Amazon S3 Tables 目录中创建 AWS Lake Formation 资源链接,以单一权限模型向其他分析引擎共享表。该系列前两部分分别覆盖 Iceberg 表创建与写入,以及 DELETE/UPDATE/MERGE 行级修改。

推荐理由:Redshift 对 Iceberg 的写入与 ALTER 演进能力,关系到湖仓架构中多引擎共享、模式变更和权限治理的实现方式。数据平台从业者可借此了解如何避免重写数据和重建管道来维护 Iceberg 表。
湖仓AWSAmazon RedshiftAWS Lake FormationAmazon S3 Tables
RSSClickHouse Blog周一 23:37 52

你的 Postgres 能扛住坏查询吗?

该文比较 ClickHouse Managed Postgres、Cloud SQL、PlanetScale 和 Amazon RDS 在递归查询耗尽内存时的表现,关注查询失败与集群存活。文章还解释 Postgres 的 work_mem 默认仅 4MB,且限制按查询计划中的操作而非整条查询生效,实际内存可远超该值。作者认为,在托管 Postgres 选择中,异常负载下的可靠性是一个常被忽略的维度,尤其当数据库由 Agent 自动配置和驱动时。

推荐理由:对数据库选型和平台可靠性评估有参考价值:它把“坏查询”下的故障隔离与集群存活作为托管 Postgres 的比较维度,并拆解 work_mem 等内存调优陷阱。
ClickHouseCloud SQLPlanetScaleAmazon RDS
RSSSnowflake Engineering (Medium)周一 22:01 57

Snowflake AI 账单的三层成本控制:多数团队只建了一层

文章讨论 Snowflake 上 AI 支出与仓库计算支出的差异,指出单靠预算无法治理 AI 成本,因为 agent 循环、应用默认调用大模型或开发者全天使用编码 agent 都可能快速消耗 credits。作者提出三层控制:资源预算、每用户配额和 Cortex AI Gateway,分别像烟雾探测器、限制单人和塑造路径,各有盲点。文中还标注截至 2026 年 9 月 21 日的状态:资源预算和共享资源预算 GA,每用户配额 GA 但 AI Gateway 域为 Preview,Cortex AI Gateway 自 2026 年 9 月 15 日起为 Preview。

推荐理由:Snowflake 用户和 AI 数据平台团队可借此理解 AI 成本治理为何不同于数仓成本,并获得预算、配额、网关三层落地的边界与组合思路。
平台AI化Snowflake
HNHacker News(数据关键词)周一 21:30 62

数据揭示 Reddit 刀具推荐或存水军操纵

Hacker News 热帖(26 赞)中,作者用数据调查 Reddit 刀具社区是否存在水军。作者微调 GLiNER 模型,从 r/knives、r/chefknives 等六个 subreddit 评论中抽取品牌、型号和钢材。初步发现某厨师刀品牌在“该买什么”类提及中有 31% 来自 5% 的账号,是随机预期的 4 倍。随后作者拉取这些账号历史,并预先定义 astroturfing 的数据模式以判断推荐是否被操纵。

推荐理由:该文把 Reddit 推荐社区的可信度问题转成可量化、可复核的数据分析,并用 NER 抽取品牌/型号/钢材,对做评论数据、推荐信号和风险识别的数据团队有方法参考。
RSSInfoQ (AI/数据工程)周一 19:00 47

Forter:两周让200名团队成员成为Agent构建者

Forter首席工程师Ben Maraney分享如何降低AI Agent创建门槛,让技术和非技术员工都能参与。团队利用自定义MCP服务器、结合无代码与代码平台,并有意避开复杂RAG方案。他们还协调安全与法务团队,以加速R&D内部的Agent采用。标题称两周内将200名团队成员转化为Agent创建者。

推荐理由:该实践展示了企业内部规模化构建Agent的落地路径,涉及MCP、无代码/代码平台、RAG取舍与安全法务协同,对数据团队建设Data Agent和提升内部采用率有参考价值。
RSSDatabricks Blog周一 15:01 46

营销与数据工程最常误解的24个数据术语

文章以“inactive customers”“real-time”等为例,说明营销团队与数据工程团队常对同一数据术语理解不同:前者可能指90天未购买,后者却按30天未打开应用定义;前者期待15分钟刷新,后者理解为秒级更新。文中围绕营销活动执行的五个问题,整理了24个常见误解术语,并给出营销与数据工程两方的对照定义。作者建议在项目开始前用这些定义澄清假设、对齐“客户”“受众就绪”“信号新鲜度”等含义,以避免活动返工。

推荐理由:帮助数据从业者理解营销侧对字段、事件、实时性等术语的真实预期,并给出可复用的对齐框架,减少数据交付与活动执行间的返工。
数据人Databricks