分析 Agent 框架、工具调用与评估——从玩具到生产的工程化
近 7 天收录 69 个事件 · 每 6 小时更新
AWS方案架构师构建了一个五Agent股票研究流水线,每个Agent依次工作并最终输出BUY、SELL或HOLD决策。当决策错误时,日志虽完整但无法定位是哪个Agent导致。他们使用Amazon OpenSearch Service存储图谱数据,结合Amazon Bedrock生成嵌入和推理,构建blame graph来追溯失败源头,并展示了三种常见生产故障模式。
苏格兰水务的资本投资项目团队过去需依赖大量报表或数据专家才能获取项目状态、财务、交付里程碑和风险信息。他们基于Databricks Genie构建了内部工具SPARK,通过Microsoft Teams以自然语言提问,由Copilot编排并经MCP连接Genie Space,在Unity Catalog治理下返回可信答案。该方案减少了重复报表制作,让项目团队能快速自助获取数据。
Snowflake官方博客介绍了如何充分利用CoCo,强调其已了解账户中的表、查询历史和成本,可查询数据、追踪血缘、构建管道并运行引导式技能。文章提出提示词四要素:目标、约束、上下文和验证,并建议复杂任务使用计划模式。同时通过模糊与具体提示的对比示例,说明明确指定表名、列名和条件可更快获得准确结果。
Amplitude发布两个AI能力:Code Mode和Data Assistant Agent。Code Mode让团队用SQL与Python深入分析行为数据,回答指标为何变化、哪些用户受影响、下一步该做什么,示例中产出23%转化率提升的洞察;Data Assistant Agent则识别并优先处理数据质量问题,增强分析可信度。原文还援引Anthropic 2026年6月报告,称用户认为AI最缺的是判断力与情境推理,Amplitude将此视为下一个要解决的问题。
dbt Wizard是dbt Labs推出的对话式AI工具,基于dbt项目的血缘、编译状态、测试和语义定义工作,提供构建、重构、调查、迁移四种模式。它可作为免费CLI在不到一分钟内安装,兼容dbt Core与dbt Cloud。Fivetran合伙人销售工程师撰文,阐述其如何压缩业务语言到数据模型间的翻译循环,并给出五大合作伙伴实践理由。
Hex推出了新的前沿基准DataBench,用于评估代理在复杂数据工作与分析推理上的表现。文章指出数据分析对代理而言是一个独特困难的领域:简单问题看似困难,困难问题看似简单,许多问题无法回答,错误通常隐蔽且微妙。DataBench旨在衡量代理在真实分析任务上的能力,为agentic analytics提供评测参照。
ThoughtSpot 工程博客介绍了 AgentQL——一种以 SQL 语法表达分析意图、但不用 LLM 直接生成 SQL 的能力。其背景是 Spotter 的搜索令牌(token)存在表达力缺口,无法覆盖多步对比、层级计算等复杂查询。AgentQL 选择 SQL 语法作为意图语言,同时拒绝 SQL 执行模型,以统一查询引擎执行。文章详述了背后的工程取舍与设计原则。
iFood 将原本基于 Databricks 的内部安全平台改用 ClickHouse Cloud 重建,实现了 9–16 倍查询加速,成本仅为原来的 40–50%,数据从小时级批量更新变为近实时。这一转变支持了智能体威胁狩猎:多个子代理并行查询超过 30 TB 数据,将分析师原本一周的工作缩短到约 2 小时。iFood 是巴西领先的食品配送平台,安全团队约 100 人。
MCP 2026-07-28 规范移除了 initialize 握手和会话头,新增必填的 Mcp-Method 与 Mcp-Name 头,使网关无需解析 JSON-RPC 请求体即可路由、限流和计量 Agent 流量。该改动解决了会话粘滞导致的负载均衡问题,任何请求可落在任意实例上。开发者反应分化,有人称这是对 REST 的重新发现,也有人认为标准本身才是重点。
Hex 发布 Evals,用于衡量 Hex Agent 的性能,并允许在变更上线前安全测试上下文影响,完全通过 CLI 操作。Evals 受 Hex 内部测试工作流启发,支持从简单数值结果到复杂任务(如工具使用、多方案提出、数据矛盾识别、适当拒绝回答)的评估。其采用 LLM-as-judge 读取完整对话,不仅考核答案正确性,还评估推理过程与行为。该工具旨在帮助数据团队在维护分析 Agent 时保持准确性与一致性。
爱分析发布《2026爱分析·中国本体平台市场洞察报告》,系统梳理中国市场的本体实践路径与能力演进方向。报告指出,中国市场尚未形成统一的本体定义,并归纳出知识工程、语义层、业务本体、可执行本体四条路径。报告认为,本体平台需要形成语义表达、业务计算、行动执行和持续治理的闭环,并参考Palantir作为能力参照。
TiDB工程师在SCaiLE Europe 2026上论述,单独的向量数据库并非AI应用的必要代价,而是数据同步约束下的变通方案。每个新增AI组件都会复制一份数据,带来独立的接入路径、运维和同步任务,导致栈越堆越复杂。TiDB通过同一Raft流同步行存储、列存储、向量索引和全文索引,由SQL优化器决定查询走哪个存储。文章认为分布式SQL原生支持向量搜索与分析能力,可减少数据漂移和多系统运维成本。
TiDB SCaiLE 2026 将于10月15日在美国山景城计算机历史博物馆举行,会议分为 AI-Native 与 Enterprise 两大 track。Manus 迁移至 TiDB Cloud 后三个月内接近 100 万数据库租户,超过 90% 的新集群由 Agent 创建。Atlassian 将 750 多个 PostgreSQL 集群整合到 16 个 TiDB 集群,承载超 300 万张表。议程强调真实生产数字与权衡,包括评估后未选择 TiDB 的团队分享。
PGlite开发方ElectricSQL加入Databricks,双方计划把WASM Postgres带入AI Agent沙箱。每个Agent可在自己的运行环境中获得低延迟本地数据库,并通过同步引擎连接中心状态。这让Databricks的Postgres能力从湖仓进一步延伸到边缘和Agent运行时。
Databricks用401个真实内部任务对Genie Code与三款通用Coding Agent进行评测。厂商公布的结果显示,Genie Code准确率为76.6%,平均每项任务成本0.55美元,正确答案成本不到最接近对手的一半。该结果属于Databricks自建基准,应结合评测设计审慎解读。
MotherDuck推出Guides,把指标定义、表关系、历史迁移和业务例外等说明作为可查询、可版本化的上下文保存在数仓中。Agent在执行查询或构建数据任务时,可以按需发现并加载这些说明,减少仅凭schema猜测业务语义造成的错误。
MotherDuck认为,LLM最近半年才开始较稳定地生成SQL,数据Agent并没有错过窗口。新的挑战是Agent会在很短时间内发起大量探索和验证查询,而传统数仓主要围绕人工交互与定时任务设计,需要重新考虑并发、隔离和成本控制。
Anthropic发布Claude企业版Cowork与插件更新,支持管理员创建私有插件市场,可控制插件、连接器和技能。新增多部门适用的插件和连接器,并支持Claude跨Excel和PowerPoint端到端编排。插件构建更简单,并新增统一'Customize'菜单管理插件、技能和连接器。
Anthropic发布面向金融服务的Claude部署指南,涵盖Claude Chat、Cowork、Code、Microsoft 365插件及平台和托管Agent等产品矩阵,提供10个预构建金融Agent参考架构(如招股书生成、市场研究、KYC筛选、总账对账、月末结账等),包含AIG、澳大利亚联邦银行、IG Group和Moody's的客户案例,以及基础-试点-推广三阶段采用手册。指南面向决定Claude部署的AI领导者和实施工程师。
Anthropic于2025年12月19日发布文章,介绍如何结合Skills和MCP构建遵循工作流程的智能体。MCP负责连接外部工具,Skills则教导Claude如何高效使用这些工具。例如,通过MCP连接Notion并添加会议准备技能,Claude能自动提取相关页面并按团队标准格式化文档。文章还发布了Agent Skills开放标准,旨在实现跨平台的可移植性。
Claude Code团队在官方博客中定义了agentic循环的概念,即智能体重复工作周期直至满足停止条件,并依据触发方式、停止条件、所用Claude Code原语和适用任务类型,将循环分为基于turn、目标驱动、基于时间和主动式等几类。文章提供了从turn-based循环逐步过渡到更复杂循环的实践指南,并讨论了在管理token消耗的同时保证代码质量的策略。作者强调并非所有任务都需要复杂循环,建议从最简单的方案开始,有选择地使用这些模式。
Anthropic的Chris Olah指出,生成式AI系统如Claude更多是“生长”而非“构建”,因此构建应用时对模型的假设会过时。本文介绍Agent Harness(模型外的软件脚手架,包括循环、工具、上下文管理和护栏)设计的三种模式:利用模型已知能力、审视可停止的步骤、谨慎设置边界。例如Claude 3.5 Sonnet在SWE-bench Verified上仅凭bash和文本编辑器工具达到49%的成绩,说明应让模型主导而非依赖复杂工具。
Anthropic副CISO Jason Clinton撰文介绍其安全工程团队如何保障由AI主导的软件开发流程安全。目前Anthropic合并的代码中约80%由Claude编写,超过一半代码由内部版本的Claude Tag合并,人类工程师负责指导、设定意图并最终批准。文章详述了针对受攻击或提示注入的智能体、供应链和依赖投毒等威胁的安全策略,包括将安全左移并与开发阶段全面整合等。
本指南介绍了如何为Claude创建自定义Skills,通过SKILL.md文件扩展其能力。文中强调了Skills能编码机构知识、标准化输出并处理复杂多步骤工作流。提供了创建Skills的5个步骤,包括明确核心需求、编写名称、描述和指令等。此外,还提供了技能创建者模板和手动创建方法,并说明了触发机制的关键要素。
Anthropic发布Claude Opus 4.6和Sonnet 4.6的同时,更新了网络搜索和网页抓取工具。Claude现在可在搜索过程中原生编写并执行代码,在结果进入上下文窗口前动态过滤,保留相关内容,去除无关信息,从而提高准确性和令牌效率。在BrowseComp和DeepsearchQA两个基准测试中,动态过滤使性能平均提升11%,同时输入令牌减少24%。开发者可通过API启用该功能。
Anthropic为Claude Code等产品发布skill-creator增强功能,支持技能作者编写评估、运行基准测试,并在模型演进时保持技能持续有效。自去年十月推出Agent Skills以来,多数作者并非工程师,缺少工具判断技能是否兼容新模型、正确触发或改进有效。新功能将软件开发的测试、基准测试和迭代改进引入技能创作,无需编写代码。
Anthropic发布Claude apps gateway,面向Amazon Bedrock和Google Cloud上的Claude Code用户。该网关是一个自托管控制平面,提供企业SSO登录、集中策略管理、基于角色的访问控制和按用户成本归属功能,解决了此前需为每位开发者配置云凭证、手动推送设置及单独工具跟踪开销的问题。网关以单个无状态容器运行于Linux,基于PostgreSQL,支持OIDC身份验证,并通过OTLP向用户指定的采集器上报使用指标,客户端在登录时自动应用托管设置。
Anthropic分享了在Claude Code中构建和扩展数百个内部技能的经验。技能是代理可以发现的指令、脚本和资源的文件夹,而不仅仅是markdown文件。通过梳理内部技能,他们发现技能分为九类,最佳技能应清晰归类。文中还讨论了如何构建技能、何时分享等最佳实践。
Anthropic宣布Claude Managed Agents现可在企业控制的沙盒中运行,并连接私有MCP服务器。沙盒可部署在自有基础设施上,也可使用Cloudflare、Daytona、Modal或Vercel等托管提供商。自托管沙盒已进入公开测试阶段,MCP隧道为研究预览,需申请访问权限。
Databricks介绍如何让Genie Agents同时基于结构化数据(如Managed Tables、Views、Metric Views等)和非结构化文件(Unity Catalog Volumes)进行分析与回答,而无需在系统间桥接数据。其治理核心在于Genie Agents以最终用户身份运行,Unity Catalog通过AIM、对象权限、ABAC、行过滤器和列掩码自动执行权限控制。这样单一Agent即使访问大量数据,也不会向错误的人泄露错误信息,且无需额外设置即可继承现有治理体系。
dbt Labs宣布dbt Summit 2026将于9月15-18日在拉斯维加斯Cosmopolitan举行,重点围绕AI时代的数据基础展开。峰会设有两个主旨演讲和四大支柱议题,包括升级引擎、为AI升级、用AI升级等方向。文章强调,许多组织的数据尚未达到可支撑AI代理的水平,而dbt正在帮助团队弥合这一差距。
Databricks博客介绍了利用Omnigent上下文策略防御AI代理的“致命三要素”:私有数据访问、不可信内容暴露和外部通信能力。当会话同时触及其中两项时,策略会阻止数据外发步骤,防止数据泄露。该方法弥补了传统逐操作权限检查缺乏上下文的缺陷,且仅在实际访问数据时触发,不影响常规单腿操作。
Snowflake AI Research与Bespoke Labs发布研究成果,回应为何在相同前沿模型下选择CoCo而非Claude Code、Codex或Cursor。他们指出模型并非整个代理,围绕模型构建的harness——包括如何探索仓库、对平台的认知、何时停止——决定了相同模型能完成的任务和成本。数据显示,同样的模型通过优化harness可实现3.9倍的成本降低。
AWS博客介绍如何部署一个基于Amazon Bedrock的开源AI代理,自动分析账户内每个Kinesis Data Streams流,对比Provisioned、On-demand Standard和On-demand Advantage三种容量模式的成本,并推荐最优模式。该代理可按日或周调度运行,无需人工干预,帮助节省超过60%的流处理成本。
Model ML利用GPT-5.6 Sol处理金融工作,覆盖从研究分析到生成可编辑、可追溯的PowerPoint演示文稿和Excel工作簿的完整流程。该方案展示了AI Agent在金融数据工作流中的端到端自动化能力。
文章提出数据分析Skill本质是操作流程,需先明确问题、数据底表、操作步骤和输出成果,再借助Codex、Claude Code、Trae等AI工具生成。强调放弃通用Skill,按业务场景拆分,并给出指标异动、用户行为、效果评估、预测、策略优化五大问题类型及各自解法。最后指出AI不能替代数据治理和业务沟通,底表设计和业务假设仍需人工把控。
Anthropic联合研究机构调查超500名技术领导者,发现57%的组织已部署多阶段工作流AI代理,81%计划在2026年应对更复杂用例。近90%组织用AI辅助开发,60%将数据分析和报告生成列为最高影响用例。
Carta Healthcare基于Claude for Amazon Bedrock构建临床数据抽象平台Lighthouse,年处理22,000例外科手术病例,准确率达99%。该公司成立于2017年,CEO为Brent Dover,过去3年增长10倍,支持125+家医院。文章强调上下文工程在AI系统规模化中的关键作用。
Anthropic宣布Claude Cowork更新,推出面向财务场景的新插件和跨应用工作流。Claude现在可在Excel和PowerPoint之间无缝传递上下文,完成多步骤财务任务。新增五个金融插件,并支持FactSet、MSCI的MCP连接器,以及LSEG和S&P Global的合作伙伴插件。财务专业人士可在单一会话中完成从市场数据研究到更新模型和制作报告的全流程。
Anthropic发布MCP第五版规范MCP 2026-07-28,协议核心改为无状态请求/响应模型,支持serverless与边缘部署。扩展框架标准化,授权对齐OAuth 2.0/OIDC,便于接入企业身份系统。支持正逐步推广到Claude全线产品。MCP月SDK下载量已超4亿次,今年实现4倍增长。
Anthropic宣布在Claude中引入MCP Apps,用户可直接在对话中打开并操作Asana、Slack、Figma等工具。该功能支持实时协作,例如在Amplitude中构建分析图表并调整参数,或在Box中预览文档并提取洞察。MCP Apps将工具变成交互式连接器,无需切换标签页即可完成项目管理和可视化任务。
Anthropic正与全球大型另类投资管理公司Millennium合作,共同开发基于Claude的数字风险分析师。该AI智能体将在人类风险经理监督下工作,用于揭示新风险洞察并评估各类资产的风险敞口。Claude和Claude Code已在Millennium的交易、工程及核心业务部门广泛使用,此次合作将进一步扩展其应用。
Hebbia为金融机构构建AI尽职调查软件,客户覆盖Top50资产管理公司中超过三分之一及顶级投行和律所。其meta-prompting技术将自然语言请求转化为提示,由Claude逐步执行。在最新测试中,Claude Fable 5取得了研究团队记录的最大准确率提升,并能追踪此前模型遗漏的复杂查询。创始产品经理Divya Mehta约一半时间用于服务核心客户。
Anthropic 发布博客文章,介绍多智能体协调的五种模式:生成器-验证器、编排者-子智能体、智能体团队、消息总线、共享状态。文章强调从最简单模式开始,根据问题演进。适合已决定使用多智能体系统的团队参考。
Anthropic API推出代码执行、MCP连接器、Files API和最长1小时提示缓存四项新能力,帮助开发者构建更强大的AI Agent。这些功能可结合Claude Opus 4和Sonnet 4,实现高级数据分析、外部系统连接及跨会话文件存储。同时扩展提示缓存可在60分钟内维持上下文并降低成本。官方展示了项目管理Agent通过Asana集成和文件分析的应用示例。
Anthropic团队在Claude官方博客发布2026年提示工程最佳实践指南。文章归类为Agents,指出提示工程是构建更好AI输出的关键,并与上下文工程加速融合。相比含糊的提示,经过精心设计的提示能将目标一次到位,减少多轮澄清成本。文章提供了从日常简单习惯到复杂项目高级方法的实用技巧。
Anthropic官方博客探讨如何让Agent连接外部生产系统,总结直接API调用、CLI与MCP三种主流路径。文章指出,直接API调用在集成数量增多后会面临M×N集成难题,而MCP作为通用协议层,能减少定制化成本,因此成为生产级Agent落地的关键方向。
Anthropic于2024年10月24日发布Claude.ai内置分析工具,可让Claude直接编写并运行JavaScript代码,实现精确数据分析与实时洞察。该工具面向所有Claude.ai用户开放预览,支持处理CSV文件、清洗探索数据并生成可视化结果。2025年11月5日,Anthropic更新称该工具已被更强大的代码执行能力取代,新增文件下载、图表生成及多步工作流支持。
Anthropic 于 2024 年 5 月 30 日宣布,Claude 的工具调用功能正式全面可用,覆盖 Claude 3 全模型家族,并支持 Anthropic Messages API、Amazon Bedrock 和 Google Cloud Vertex AI。通过该功能,Claude 可连接外部工具与 API,执行任务、操作数据并提升回答准确性。典型场景包括从发票中提取结构化数据、将自然语言请求转为 API 调用、检索数据库回答问题以及自动化数据录入等。Anthropic 同时改善了开发者体验。
Model Context Protocol(MCP)是连接AI助手与外部工具的开放标准,被誉为“LLM的USB-C”。它让Claude等AI助手无需自定义集成即可访问数据与工具,替代手动复制粘贴上下文。本文介绍MCP的定义、价值与应用场景,值得数据从业者了解AI与数据工具集成的新范式。
Anthropic 宣布 Claude Managed Agents 新增两项公开 beta 功能:可按 cron 计划自动运行,并可在 vaults 中安全存储环境变量。计划部署适用于夜间数据同步、每周合规扫描等重复任务。Rakuten 已用其分析电子表格数据并生成报告。该功能还支持暂停、恢复和按需触发。
OpenAI公开了其内部自建数据智能体的实践细节。该智能体为3500多名员工提供数据服务,覆盖7万个数据集、超过600PB数据。它将获取洞察的时间从几天缩短到几分钟,显著降低各职能部门的数据分析门槛。智能体结合Codex驱动的表格级知识与持续学习记忆,可执行端到端分析。
传统自助业务分析面临视图混乱和仪表板膨胀等难题。Anthropic通过Claude实现了95%业务分析查询的自动化,总体准确率约95%。这一实践的关键是避免让AI“裸奔”于数仓之上,而是连接基础设施、文档与专家知识。数据团队得以从重复工作中解放,专注于战略任务。
本文是Anthropic基于与数十个团队的合作经验,分享构建LLM代理的实用建议。文章指出,最成功的实现往往采用简单、可组合的模式,而非复杂框架。Anthropic区分了工作流与代理,并强调在构建应用时应从最简单方案开始,仅在必要时增加复杂性。
Anthropic工程团队分享了构建Claude Research多智能体系统的历程与经验。该系统利用多个Claude代理并行探索复杂主题,解决了开放研究任务中无法预定义路径的难题。文章深入剖析了多智能体系统在协调、评估和可靠性方面面临的挑战,并总结了关键技术决策。
文章提出一套鉴别真假Data Agent的审查清单:真正的企业级Data Agent需同时满足语义层、目标驱动、证据链与自愈、权限治理、反馈沉淀五项要求。判断基准是它不能只是“会写SQL的聊天框”,必须回答理解数据、安全访问、可验证结果、沉淀资产四个问题。作者直言市场上八成产品只是NL2SQL套聊天框,用半小时逐项验证即可识别套壳。
阿里云DMS推出Data Agent for Analytics,定位企业级数据分析智能体,基于Agentic AI技术,帮助用户查数据、做分析、生成报告并深入洞察。文章从能力边界定义、技术内核、企业级能力三方面剖析其技术思考与实践,为开发者提供参考。
文章梳理数据分析工具从Excel、BI到ChatBI的演进困局,指出传统BI与ChatBI仍是被动响应、答案导向,未能解决数据问题向业务问题的转化。火山引擎数智平台VeDI提出Data Agent概念,强调从“数据工具”升级为“数字专家”,实现从记录过去到理解现在、预测未来的跨越。
本文用生活化类比拆解RAG与Reference两类AI知识库的本质区别:RAG是先搜后答的自动搜索引擎,Reference是按人定规则调用的手动文件柜。通过退货政策PDF案例,清晰对比了两者工作流程与适用场景,帮助数据从业者理解知识库底层机制与选型要点。
Stripe工程团队近日分享了如何将全球基础设施建模为图,结合图搜索算法与状态机,自动计算并执行数据库事故修复方案。该方法旨在减少人工干预,提升数据库运维的自动化水平。
AICon深圳大会将于2026年8月21日至22日举行,中软融鑫总工程师于浩军将分享金融监管领域的Harness实践。他强调Agent落地关键已从模型能力转向系统工程能力,金融监管场景零容错、强追溯、口径复杂,Agent稳定性取决于数据资产与知识资产质量。实践验证,监管报表全链路的稳定性依赖工程化治理而非单纯模型调优。
AI将报表生成提速到秒级,但业务链路中的等待可能让分析失去意义。SoFi的546个失败会话与Blend的新产品Autopilot Analytics Agent,共同指向一个被忽视的指标:行动窗口。文章建议从业务结果反推产品设计,用剩余窗口、Time to Intervention和窗口命中率重新定义数据产品优先级。
Databricks博客介绍了企业级AI助手的技术架构,涵盖大语言模型、检索增强生成和智能体框架。文章强调深度集成数据目录与治理策略的重要性,并援引市场数据称2025年全球AI助手市场规模为191亿美元,预计2035年达1141亿美元。该文对数据团队评估ChatBI与分析Agent具有参考价值。
Agentic workflows是AI驱动的流程,智能代理通过推理、工具使用和反馈的持续循环,自主规划、执行并优化多步骤任务。与传统自动化不同,代理在运行时动态调整策略并选择工具,而非遵循固定脚本。企业采用这类工作流可提升效率与扩展性,但需配合强治理、生产级基础设施和明确的业务目标。本文来自Databricks博客,是理解Data Agent落地模式的关键参考。
工具调用(Tool Calling)是AI模型与外部工具、API和系统交互的机制,使聊天机器人进化为能执行真实操作的AI Agent。Databricks在博客中详解了其工作流程,并介绍Agent Bricks平台提供受治理的工具调用构建环境,原生支持Model Context Protocol(MCP)与Unity Catalog治理。
Snowflake CoCo能将自然语言转化为实际工作,自动运行SQL、执行多步骤流程并在每轮调用大模型,token消耗会直接转化为credits费用。缺乏管控的团队可能迅速推高成本。Snowflake提供了从SQL、Snowsight或CoCo内部管理的完整成本控制体系,核心思路是三步:看清花费、优化默认运行配置、强制执行硬性限制。
dbt Labs 发文探讨企业 AI 部署从“为仪表盘建模数据”转向“为 Agent 建模上下文”。文章以自身为例,起初直接使用供应商 MCP 连接 Gong 等数据源,导致单次通话分析消耗高达 5 万 Token(约 0.25 美元),总数据量超 5 亿 Token。他们随后将原始数据摄入数仓并通过建模总结,以降低成本和掌控上下文层。
本文提出一种运行时无关的AI工作流模式,用于解决生产环境持久性与评估迭代速度之间的矛盾。通过将业务逻辑与运行环境解耦,同一套代码可以在生产与评估中运行,避免版本漂移。作者认为正确架构应让默认路径即最优路径。
数据工程师尝试用编码智能体处理SQL时,确实能获得帮助:样板代码被削减,脚手架搭建更快。但一个更棘手的 frustration 是,智能体生成的代码看似正确——语法有效、符合惯例——却不适用于实际环境。它不知道哪些表是生产表、哪些 schema 受治理、RBAC 结构如何,导致产出仍需人工重塑。