Mô tả công việc

Bạn sẽ xây dựng và vận hành Data Lakehouse ba lớp (Raw → Cleaned → Aggregated) làm nền tảng lõi cho toàn bộ AgriGreen, nơi hợp nhất dữ liệu vệ tinh Sentinel, dữ liệu GPS thiết bị, dữ liệu giao dịch và dữ liệu MRV carbon. Bạn phụ trách pipeline dữ liệu chạy được cả khi mất kết nối mạng ở vùng sâu (offline-first), đảm bảo dữ liệu đồng bộ chính xác khi có mạng trở lại.

Yêu cầu

  • Kinh nghiệm xây dựng pipeline dữ liệu (ETL/ELT) và kiến trúc Data Lakehouse ở môi trường thực tế
  • Thành thạo SQL và ít nhất một ngôn ngữ xử lý dữ liệu (Python/Scala)
  • Hiểu các bài toán dữ liệu đa nguồn: ảnh vệ tinh GIS, cảm biến IoT, dữ liệu vận hành theo thời gian thực
  • Ưu tiên người từng làm việc với dữ liệu có yêu cầu kiểm định/audit chặt chẽ (tài chính, ESG, chuỗi cung ứng)

Quyền lợi

  • Trực tiếp thiết kế tầng dữ liệu lõi cho một hệ sinh thái phục vụ 21.000 điểm chạm nguồn cung
  • Làm việc tập trung tại văn phòng Hà Nội, môi trường trực tiếp xây dựng hạ tầng dữ liệu
  • Lộ trình onboarding rõ ràng: 15-30-60 ngày, review hai chiều cùng quản lý

Định nghĩa hoàn thành (Definition of Done)

Một pipeline được coi là hoàn thành khi dữ liệu đi từ Raw đến Aggregated không cần can thiệp thủ công, có giám sát lỗi tự động và độ trễ nằm trong ngưỡng đã cam kết.

Ứng tuyển vị trí này →