● Xây dựng và vận hành pipeline ETL/ELT từ nhiều nguồn dữ liệu: database, API, logs, event streams.
● Chuẩn hoá dữ liệu, xử lý thiếu dữ liệu, dữ liệu trùng, sai format, sai schema.
● Thiết kế mô hình dữ liệu và lớp dữ liệu phục vụ AI/ML/LLM.
● Phối hợp với Data Scientist/AI Engineer để chuẩn bị dataset cho training, inference, feature engineering hoặc RAG.
● Theo dõi chất lượng dữ liệu, giám sát pipeline, xử lý lỗi và tối ưu hiệu năng.
● Tài liệu hoá pipeline, data contracts, quy tắc transform và chuẩn dữ liệu.
● Có kinh nghiệm Data Engineer từ 2 năm trở lên.
● Thành thạo SQL và Python.
● Có kinh nghiệm với ít nhất một nền tảng dữ liệu/cloud như BigQuery, Snowflake, Redshift, AWS, GCP hoặc Azure.
● Có kinh nghiệm với các công cụ pipeline/orchestration như Airflow, dbt, Spark, Kafka là lợi thế.
● Hiểu tư duy chuẩn hoá dữ liệu, data quality, schema management, data observability.
● Có kinh nghiệm làm việc với dữ liệu phục vụ AI/ML là điểm cộng.
● Ưu tiên ứng viên có kinh nghiệm open source: từng đóng góp, maintain, fork, build plugin/package hoặc có GitHub profile/dự án public liên quan đến data engineering/AI. Việc tham gia open source thường gắn với kỹ năng cộng tác, hiểu hệ thống thực tế và mức độ cập nhật công nghệ tốt hơn.