资深数据开发工程师(自动驾驶数据平台) _XC
工作模式
在工地的
工作领域
工程
加入为
专业人员
合同类型
有限期
工作时间
全日制
赔偿
根据协议
你的任务
岗位描述
作为数据平台核心成员,主导自动驾驶「车队 → 采集 → 标注 → 数据集 → 模型评测」端到端数据平台的架构设计与技术演进,构建 PB 级、高可用、可扩展的数据查询、存储、处理与挖掘体系,并带领团队攻坚关键技术难题。
岗位职责
- 架构主导:负责数据平台整体架构设计与技术选型,主导统一数据访问层建设,对接 Trino(分布式 SQL)、Lance(列存 + 向量检索)、LevelDB(KV)等多引擎;
- 管道建设:规划并落地海量车端数据采集、清洗、入仓的全链路管道(Rosbag 解析抽取、MongoDB/MySQL 同步、COS 对象存储流转),保障 TB/PB 级数据稳定流转;
- 调度平台:设计 Celery + Redis 多队列异步调度平台,定义任务编排、重试、限流、监控规范,支撑数据处理、质量视频生成、评测批次等大规模长耗时任务;
- 性能攻坚:主导 Trino 查询优化(谓词下推、列裁剪、查询计划分析)与慢查询治理,制定查询性能与成本治理体系;
- 数据挖掘:基于 Lance 向量检索(KNN)构建相似场景召回能力,推动数据挖掘与高价值数据筛选体系建设;
- 安全合规:建立数据安全合规规范——SQL 注入防御、语句白名单、列级脱敏、写操作审计、分级授权(L1 只读 / L2 授权写 / L3 后端专属)、QPS 限流;
- 技术影响力:制定团队技术规范与最佳实践,进行代码评审、技术分享与人才培养,推动跨团队协作(采集 / 标注 / 评测)。
您的个人资料 任职要求
- 本科及以上学历,计算机相关专业,5 年以上数据开发经验,有大型数据平台 / 数仓 / 湖仓架构落地经验;
- 精通 Python,熟悉 Django / DRF;具备扎实的分布式查询引擎(Trino / Presto / Spark SQL 等)原理与调优能力;
- 精通至少两类数据存储引擎:列存 / 湖仓(Lance / Parquet / Iceberg / Hudi)、KV(LevelDB / RocksDB)、OLAP(ClickHouse / Doris 等);
- 深入理解 Celery / Redis 异步调度与消息队列(MQ / Kafka),有大规模任务编排与稳定性治理经验;
- 熟练掌握 Docker / Kubernetes,具备容量规划、监控告警、故障排查与高可用设计能力;
- 具备优秀的系统设计、抽象建模与复杂问题拆解能力,有技术方案主导与团队带教经验;
- 强烈的数据安全与质量意识,良好的跨团队沟通与推动能力。
加分项
- 有自动驾驶 / 车联网 / 海量时序 / 多模态数据处理经验;
- 精通向量检索(KNN、cosine / L2、ANN 索引)与数据挖掘召回体系;
- 有数据平台 0→1 建设或大规模重构经验;
- 熟悉 SDK / OpenAPI 代码生成(oapi-codegen)、契约化接口治理;
- 有开源贡献、技术专利或行业技术影响力。
任职要求
- 本科及以上学历,计算机相关专业,5 年以上数据开发经验,有大型数据平台 / 数仓 / 湖仓架构落地经验;
- 精通 Python,熟悉 Django / DRF;具备扎实的分布式查询引擎(Trino / Presto / Spark SQL 等)原理与调优能力;
- 精通至少两类数据存储引擎:列存 / 湖仓(Lance / Parquet / Iceberg / Hudi)、KV(LevelDB / RocksDB)、OLAP(ClickHouse / Doris 等);
- 深入理解 Celery / Redis 异步调度与消息队列(MQ / Kafka),有大规模任务编排与稳定性治理经验;
- 熟练掌握 Docker / Kubernetes,具备容量规划、监控告警、故障排查与高可用设计能力;
- 具备优秀的系统设计、抽象建模与复杂问题拆解能力,有技术方案主导与团队带教经验;
- 强烈的数据安全与质量意识,良好的跨团队沟通与推动能力。
加分项
- 有自动驾驶 / 车联网 / 海量时序 / 多模态数据处理经验;
- 精通向量检索(KNN、cosine / L2、ANN 索引)与数据挖掘召回体系;
- 有数据平台 0→1 建设或大规模重构经验;
- 熟悉 SDK / OpenAPI 代码生成(oapi-codegen)、契约化接口治理;
- 有开源贡献、技术专利或行业技术影响力。