今日热榜
完整榜单 →为 Amazon MWAA 构建 LLM 驱动的 DAG 故障分析插件
Apache Airflow 已成为数据管道编排核心,但当管道扩展到数百个 DAG 并跨 AWS Glue、Amazon EMR、Amazon Athena、Amazon Redshift 等服务时,单个任务失败排查非常耗时。本文介绍如何构建自定义 Airflow 插件,集成 Amazon Bedrock(Anthropic Claude)自动分析 DAG 任务失败,并给出可操作的诊断洞察。插件部署在 Amazon MWAA 上,在 Airflow UI 中提供按需 AI 根因分析。完整源码已发布在 GitHub 示例仓库中。
AWS 在 Amazon EMR on EKS 上支持 Spark Connect
AWS 宣布在 Amazon EMR on EKS 上支持 Spark Connect,起始版本为 EMR 7.14(Apache Spark 3.5.8)与 emr-spark-8.1(Apache Spark 4.1.1)。开发者可在 VS Code、PyCharm、Jupyter、SageMaker Unified Studio 等本地工具中构建、测试和调试 PySpark 应用,实际计算则路由到 EKS 上的 Spark 集群执行。该能力基于客户端-服务端架构,通过 gRPC/TLS 连接,旨在解决本地环境与远程集群之间的依赖冲突和规模性能差异。每个 Spark Connect 会话可使用独立的 IAM 执行角色与自定义标签,便于权限隔离和成本追踪,AWS 还提供了端到端示例 notebook。
Aurora PostgreSQL 与 SageMaker zero-ETL 集成
AWS 推出 Amazon Aurora PostgreSQL 与 Amazon SageMaker 的 zero-ETL 集成,将 Aurora PostgreSQL 数据近实时复制到 AWS Glue Data Catalog,并以 Apache Iceberg 表形式提供分析访问。该集成基于 CDC,通过增强逻辑复制捕获事务日志中的插入、更新和删除,减少传统 ETL 管道的延迟、运维开销与数据孤岛。用户可在 SageMaker 中结合 S3 数据湖和 Redshift 数仓的数据,用 SQL、Spark、BI 及 AI/ML 工具分析同一份数据。文章还介绍了 Lake Formation 的统一访问控制、湖仓架构和配置查询流程。
Snowflake交互式数仓上的一体化AI应用与可观测性
作者在单个 Snowflake Interactive Warehouse 上同时构建零售运营 AI 应用和其可观测性管线。Cortex Agents 基于 Semantic View 生成 Text-to-SQL,查询约 2500 万行销售数据;AI Observability 自动将 trace、span、工具调用和 token 数写入 SNOWFLAKE.LOCAL.AI_OBSERVABILITY_EVENTS,无需 SDK 或 collector。监控看板与 Agent 共用同一仓库,最终发现了一个被 Agent 100% 成功率掩盖的语义视图缺陷。完整 SQL、代码和 Streamlit 应用已发布在 GitHub。
Lakebase Search:为 Postgres 带来全文与向量搜索
Lakebase 为 Postgres 推出 Lakebase Search,包含 lakebase_vector(可扩展近似邻居搜索)和 lakebase_text(BM25 全文搜索)两个扩展,现已在 AWS 和 Azure 正式可用。官方称在 VectorDBBench 100M 基准上,lakebase_vector 吞吐量达到次优系统的 2 倍,成本仅为使用 pgvector 的云 Postgres 厂商的 1/4。其测试显示在 100M LAION 数据集上,97% recall 时 P99 延迟为 71 毫秒。客户 Conexiom 使用 BM25 混合搜索处理超 1 亿行数据,计算资源仅为此前 pgvector 方案的一半。
Jev与DuckDB:在SQL中用自然语言条件
TypeSafe AI于2026年9月15日发布Jev模型,它返回带概率的类型化答案而非文本段落,支持是/否、选项和评分三类问题。发布一周内,社区为DuckDB开发了扩展,可用自然语言条件对CSV、Parquet或表进行过滤、分类和打分,约1000行数据耗时约10秒。Jev报告端到端延迟70-500毫秒,输入token价格0.042美元/百万。文章介绍了Jev的机制、DuckDB扩展的工作方式及相关讨论。
ClickHouse Fabric 工作负载公测:OneLake 亚秒级分析
ClickHouse Workload for Microsoft Fabric 现已公开预览,可从 Fabric 工作负载中心获取,把 ClickHouse 作为 OneLake 的加速层。用户可将 OneLake 表同步到专属 ClickHouse Cloud 服务,在 Fabric 内以亚秒级响应查询数十亿行,且 OneLake 保持唯一事实源。该工作负载使用 Microsoft Entra 账户在 Azure 上开通专属 ClickHouse Cloud 计算,含试用,可服务 AI agent、仪表盘和应用而不消耗 Fabric 容量。它还提供内嵌 SQL 控制台、Power BI 认证连接器、Fabric notebook 及面向 Copilot Studio/GitHub Copilot 的只读治理访问。
BigQuery支持Gemini 3.1 Flash Lite与3.5 Flash GA模型
BigQuery宣布正式支持gemini-3.1-flash-lite和gemini-3.5-flash GA模型,适用于us、eu及global多区域端点。用户可在所有生成式AI函数中使用这些模型。该更新源自BigQuery官方发布说明。
Cloudflare推出智能体开发生命周期,取代传统SDLC
Cloudflare提出智能体开发生命周期,用自动化软件工厂替代传统软件开发生命周期,通过Workflows编排层与@cloudflare/ci工具链支持智能体自主完成开发、测试、部署和自我改进。平台强调可编程、水平扩展、事件驱动,为每个智能体创建预览部署并并行测试生产环境,同时提供OpenTelemetry兼容的可观测性与基于短期凭证的智能体访问模型。
Databricks 如何让1.4万员工首日接入前沿模型
Databricks 官方博客介绍其让上万名员工在新模型发布首日即可试用前沿模型的机制,核心依托 Unity Gateway 进行自适应发布、评估与成本控制。文中披露:被宣传为前沿的模型未必更好,如 Opus 5.0 成本更高且工程师质量评分低于 Opus 4.8。无成本约束地开放 GPT Astra 时,开发者平均支出增加 60%,因此采用按用户预算限制与用量引导。在 Opus 5、GPT-6 Sol 与 GPT-Luna 密集发布的当周,Databricks 全员首日接入,第 3 天即用数据确认其处于效率前沿并纳入基础设施。
Genie One 企业级推广分步 playbook
区域销售总监想了解东北 pipeline 本季走弱的原因,却要等懂可信数据的分析师到周四,最终只能在缺少答案的情况下决策。Genie One 旨在让业务人员用自然语言提问,获得基于受治理数据并引用来源的回答,并快速启动后续多步工作。原文认为,AI 推广停滞常因一次性铺开过多数据域、不同团队对“活跃客户”定义不一、语义层无人负责且缺乏答案校验机制。其落地 playbook 建议从窄问题集开始,先赢得早期采用者信任,再依据反馈逐步扩展到更多业务线,并包含 Genie One、领域特定 Genie Agents、Genie Ontology 等组件。
制造业数据与AI:连接产品价值链
文章指出制造缺陷往往跨越机器设置、供应商批次、物流事件和质量系统,相关数据被分割在工厂、职能和系统边界中。它回顾了50多年前Joseph Harrington提出的计算机集成制造(CIM)愿景,并认为现代数据与AI平台正让连接产品价值链变得可行。核心跨阶段问题包括:受影响产品涉及哪些供应商批次、缺陷是否曾出现及纠正措施是否有效、哪些客户或服务案例可能受影响。文章强调制造商需要的是带治理和业务上下文的跨系统信息流,而不是更多孤立报表。
chDB 为 Agent 记忆提供持久化层
chDB 是 ClickHouse 驱动的嵌入式 SQL OLAP 引擎。团队曾用 chDB 在单台笔记本上为 coding agent 保存项目规则、用户偏好、决策、原始转录和召回轨迹,运行数周后却无法把状态带到 CI、可能一小时即消失的沙箱或第二台笔记本。改用 ClickHouse server 后端虽可移植,但会把本地 recall 变成带凭据、连接管理和远程延迟的网络查询。chDB Durable Layer 试图把可恢复的分析状态存入自有对象存储,同时保留本地查询速度。
Snowflake 10.29 发布:按用户配额正式可用
Snowflake 发布 10.29 版本说明,按用户配额正式可用,可为账户内单个用户设置月度与日度信用额度,并按阈值通知。配额覆盖仓库计算与 AI 功能域,包括 AI Functions、Snowflake CoCo、Cortex Agents 和 Snowflake CoWork,并可自动阻止超限用户访问 AI。正式版更新包括阻止通知开关、按月度或日度限额定阈值、QUOTA_ACCESS_BLOCK_HISTORY 视图,以及配置传播时间约 5–10 分钟。
Redshift Iceberg 写入支持 Part 3:模式与分区演进
AWS 官方博客 Part 3 以客户和订单数据集为例,演示如何通过 ALTER 操作演进 Amazon Redshift 中的 Apache Iceberg 表模式与分区布局。操作包括重命名/新增/删除列、扩展列类型、设置表属性,以及新增/删除/替换分区字段,这些变更均为元数据操作,无需重写数据或重建管道。文章还介绍在 Amazon S3 Tables 目录中创建 AWS Lake Formation 资源链接,以单一权限模型向其他分析引擎共享表。该系列前两部分分别覆盖 Iceberg 表创建与写入,以及 DELETE/UPDATE/MERGE 行级修改。
你的 Postgres 能扛住坏查询吗?
该文比较 ClickHouse Managed Postgres、Cloud SQL、PlanetScale 和 Amazon RDS 在递归查询耗尽内存时的表现,关注查询失败与集群存活。文章还解释 Postgres 的 work_mem 默认仅 4MB,且限制按查询计划中的操作而非整条查询生效,实际内存可远超该值。作者认为,在托管 Postgres 选择中,异常负载下的可靠性是一个常被忽略的维度,尤其当数据库由 Agent 自动配置和驱动时。
Snowflake AI 账单的三层成本控制:多数团队只建了一层
文章讨论 Snowflake 上 AI 支出与仓库计算支出的差异,指出单靠预算无法治理 AI 成本,因为 agent 循环、应用默认调用大模型或开发者全天使用编码 agent 都可能快速消耗 credits。作者提出三层控制:资源预算、每用户配额和 Cortex AI Gateway,分别像烟雾探测器、限制单人和塑造路径,各有盲点。文中还标注截至 2026 年 9 月 21 日的状态:资源预算和共享资源预算 GA,每用户配额 GA 但 AI Gateway 域为 Preview,Cortex AI Gateway 自 2026 年 9 月 15 日起为 Preview。
数据揭示 Reddit 刀具推荐或存水军操纵
Hacker News 热帖(26 赞)中,作者用数据调查 Reddit 刀具社区是否存在水军。作者微调 GLiNER 模型,从 r/knives、r/chefknives 等六个 subreddit 评论中抽取品牌、型号和钢材。初步发现某厨师刀品牌在“该买什么”类提及中有 31% 来自 5% 的账号,是随机预期的 4 倍。随后作者拉取这些账号历史,并预先定义 astroturfing 的数据模式以判断推荐是否被操纵。
Forter:两周让200名团队成员成为Agent构建者
Forter首席工程师Ben Maraney分享如何降低AI Agent创建门槛,让技术和非技术员工都能参与。团队利用自定义MCP服务器、结合无代码与代码平台,并有意避开复杂RAG方案。他们还协调安全与法务团队,以加速R&D内部的Agent采用。标题称两周内将200名团队成员转化为Agent创建者。
营销与数据工程最常误解的24个数据术语
文章以“inactive customers”“real-time”等为例,说明营销团队与数据工程团队常对同一数据术语理解不同:前者可能指90天未购买,后者却按30天未打开应用定义;前者期待15分钟刷新,后者理解为秒级更新。文中围绕营销活动执行的五个问题,整理了24个常见误解术语,并给出营销与数据工程两方的对照定义。作者建议在项目开始前用这些定义澄清假设、对齐“客户”“受众就绪”“信号新鲜度”等含义,以避免活动返工。