نحن نبحث عن مهندس بيانات متمرس لتصميم وبناء وصيانة أنابيب بيانات ومنصات قابلة للتوسع تُمكّن اتخاذ القرار القائم على البيانات عبر المؤسسة. المرشح المثالي سيكون لديه خبرة قوية في هندسة البيانات الخلفية وتعرض لمحيطات البيانات الكبيرة الحديثة والذكاء الاصطناعي القائم عليها.
المسؤوليات:
- تصميم وتطوير وتحسين أنابيب بيانات قابلة للتوسع باستخدام Python أو Java.
- إنشاء وصيانة أطر ETL/ELT باستخدام Apache Spark (دفعة وتدفق).
- كتابة استعلامات SQL متقدمة لتحويل البيانات والتحقق منها وتحليلها.
- تطوير واجهات برمجة تطبيقات لمشاركة البيانات مع خدمات أخرى.
- دمج البيانات من مصادر متعددة منظمة وغير منظمة.
- التعاون مع علماء البيانات والمحللين وفرق المنتج لدعم حالات التحليلات والتعلم الآلي.
- تنفيذ آليات التحقق من البيانات، والتسجيل، والتعامل مع الأخطاء.
- تحسين أداء الأنظمة وإدارة مجموعات البيانات كبيرة الحجم.
الملف المرغوب فيه للمرشح
- درجة البكالوريوس أو الماجستير في علوم الحاسوب الهندسة أو مجال ذو صلة.
- 3+ سنوات من الخبرة العملية في هندسة البيانات أو تطوير البيانات الكبيرة.
- خبرة برمجية قوية في Python و/أو Java وScala.
- خبرة عملية مع Apache Spark (Batch & Streaming).
- الخبرة في البرمجة النصية (Python, Bash, Shell).
- مهارات تطوير API (Python, Java).
- فهم لأنظمة موزعة وهندسة البيانات الكبيرة.
- معرفة قوية بخدمات AWS (S3, RDS, Redshift, Glue, EMR, Athena, Lambda، إلخ).
- خبرة قوية في نمذجة البيانات وتخزين البيانات.
- خبرة عملية في معالجة البيانات الدفعات وتدفقات البيانات، وأدوات تنسيق جريان العمل مثل Apache Airflow.
- خبرة في التكامل عبر API والبيانات، مع اعتبار التكاملات GenAI (LLMs, LangChain) إضافة ميزة.
- مهارات قوية في حل المشكلات والتحليل والقدرة على العمل في بيئة سريعة الإيقاع.
- مهارات اتصال وتوثيق ممتازة.
We are looking for a skilled Data Engineer to design, build, and maintain scalable data pipelines and platforms that enable data-driven decision-making across the organization. The ideal candidate will have strong backend data engineering expertise and exposure to modern big data and AI- driven ecosystems.
Responsibilities:
- Design, develop, and optimize scalable data pipelines using Python or Java.
- Build and maintain ETL/ELT frameworks using Apache Spark (Batch & Streaming).
- Write advanced SQL queries for data transformation, validation, and analytics.
- Develop APIs to share data with other services.
- Integrate data from multiple structured and unstructured sources.
- Collaborate with Data Scientists, Analysts, and Product teams to support analytics and ML use cases.
- Implement data validation, logging, and error-handling mechanisms.
- Optimize pipeline performance and manage large-scale datasets.
Desired Candidate Profile
- Bachelor's or Master's degree in Computer Science, Engineering, or related field.
- 3+ years of hands-on experience in Data Engineering or Big Data development.
- Strong programming experience in Python and/or Java And Scala.
- Hands-on expertise with Apache Spark (Batch & Streaming).
- Experience with scripting (Python, Bash, Shell).
- API(Python, Java) Development skills.
- Understanding of distributed systems and big data architectures.
- Good knowledge in AWS services(S3, RDS, Redshift, Glue, EMR, Athena, Lambda, etc.).
- Strong experience in data modeling and data warehousing.
- Hands-on experience with batch and streaming data processing, and workflow orchestration tools such as Apache Airflow.
- Experience in API and data integration, with exposure to GenAI integrations (LLMs, LangChain) considered a plus.
- Strong problem-solving and analytical skills and ability to work in a fast paced environment.
- Excellent communication and documentation skills.