← 主题地图

数据人

角色演变、团队方法论与组织实践——分析工程师的进化论

近 7 天新增 3累计 33 · 每 6 小时更新

近期进展

最近 7 天内最新的 3 条

2026-09-28 · Databricks Blog

营销与数据工程最常误解的24个数据术语

文章以“inactive customers”“real-time”等为例,说明营销团队与数据工程团队常对同一数据术语理解不同:前者可能指90天未购买,后者却按30天未打开应用定义;前者期待15分钟刷新,后者理解为秒级更新。文中围绕营销活动执行的五个问题,整理了24个常见误解术语,并给出营销与数据工程两方的对照定义。作者建议在项目开始前用这些定义澄清假设、对齐“客户”“受众就绪”“信号新鲜度”等含义,以避免活动返工。

2026-09-26 · 爱分析

爱分析访谈飞数:AI接管数据生产,标注升级为数据服务

爱分析访谈飞数执行总裁谭昶,讨论AI如何改造数据生产。飞数前身可追溯至科大讯飞2001年成立的语音制作部门,2024年4月孵化成立安徽飞数,定位人工智能高质量数据生产者。原文称语音、语言、文本等成熟场景中超过90%的数据可由模型自动处理,但医疗、教育等高标准场景最后1%仍需专家兜底。飞数业务覆盖规划、采集、治理、标注、质检和持续运营,并判断具身数据将从规模竞争转向知识密度竞争。

2026-09-24 · AWS Big Data Blog

Amazon EMR on EC2 支持 Spark Connect:本地 IDE 交互式调试 PySpark

AWS 宣布在 Amazon EMR on EC2 上支持 Spark Connect,基于 emr-spark-8.0(Apache Spark 4.0.2 及以上)运行时。开发者可在 SageMaker Unified Studio Data Notebooks 或 VS Code、PyCharm、Kiro、Jupyter 等本地 IDE 中交互式开发和调试 PySpark:Python 在本地运行,计算在 EMR 集群上执行,可直接对全量数据打断点、查看 DataFrame。Spark Connect 采用客户端-服务端架构,通过 gRPC/TLS 把 DataFrame 与 SQL 操作发送到集群端 Spark Connect Server,本地无需安装 Spark 也无需按负载配置机器。每个会话拥有独立权限,因此团队可共享同一集群并行工作。

入门阅读

精选长期内容,最多 3 篇

全部动态

按发布时间倒序

营销与数据工程最常误解的24个数据术语 Databricks Blog 爱分析访谈飞数:AI接管数据生产,标注升级为数据服务 爱分析 Amazon EMR on EC2 支持 Spark Connect:本地 IDE 交互式调试 PySpark AWS Big Data Blog 从Cassandra到Snowflake:NoSQL数据集成蓝图 Snowflake Engineering (Medium) 具身数据先于机器人出货,2026年或成AI数据服务最大增量 爱分析 2026年AI与数据最佳书籍:数据与AI领导者书单 ThoughtSpot Blog 专家经验批量变AI数据:专访本原智数李逆勇 爱分析 未来转型中重新设计工作的五个思路 Visier Blog ForeFlight 通过 Amplitude 清理数据杂乱,年省 15 万美元 Amplitude Blog 创建或演进分析追踪计划的实践要点 Amplitude Blog 高质量数据如何驱动AI时代的成功 Amplitude Blog 当你无法信任自己的数据时会发生什么? Amplitude Blog 数据团队与产品团队如何休战:走向数据民主化 Amplitude Blog Fivetran:两年后,AI如何改变性能工程 Fivetran Blog 统一技能仓库:数据团队如何向AI编码代理传递代码规范 Snowflake Engineering (Medium) Strava采用Amplitude自助分析,效率提升3倍 Amplitude Blog AI时代数据分析学习路线:贴近业务+指挥AI 人人都是产品经理 一文搞懂预测模型:建模思路、分类与应用 人人都是产品经理 AI时代CDO的角色演变:数据访问、产品与治理 Fivetran Blog 企业数据治理工具选型指南 Databricks Blog Fivetran性能工程复盘:AI如何改变两年提速之路 Fivetran Blog dbt on Snowflake实践:把编排搬进数仓后真正的问题 Snowflake Engineering (Medium) Databricks处理数据,dbt定义数据含义 dbt Blog 为Token建模而非表:dbt仓储上下文节省20倍成本 dbt Blog Amtrak 构建铁路智能平台,用 Databricks 统一数据骨干 Databricks Blog AI如何改写数据分析师的职责 Databricks Blog CWT如何将AI分析转化为数百万美元资产 ThoughtSpot Blog Epic Games如何调优OpenSearch支撑Fortnite分析 AWS Big Data Blog 数据分析Skill设计指南:从问题定义到流程拆解 人人都是产品经理 银行目标部门分析筛选:乙方视角的部门墙拆解 人人都是产品经理 AI秒级出报表,为何业务仍来不及? 人人都是产品经理 Fivetran用AI构建状态页,替换6.5万美元SaaS Fivetran Blog ClickHouse成立基础数据库研究团队ClickHouse Labs ClickHouse Blog
涉及 27 个厂商 展开查看
AWSAmazon EMRAmazon SageMakerAmplitudeApache SparkBigQueryBlendClickHouseDataStaxDatabricksFivetranGlassboxGongOraclePostgreSQLPowerBISnowflakeTableauThoughtSpotTwilio SegmentVisierdbtdbt Labs数据堂本原智数科大讯飞飞数