Full Time 6 - 8 Years of Experience Bayt
Remote - Jordan - Amman · Yesterday
Information Technology
<h2 class="h5">Job description</h2>
<div class="t-break" data-jb-field="description">
<p>Build pipelines that process large volumes of documents (PDF, Word, Excel, and scanned fi les, inEnglish and Arabic) into clean, structured data.</p><p>Use LLMs and vision-language models to extract key details into defi ned schemas (structuredoutputs).</p><p>Classify documents and rank them against business-defi ned criteria, and explain why each rankingwas given.</p><p>Build retrieval over document collections so users and agents can search and ask questions.</p><p>Build evaluation:</p><p>labelled test sets</p><p>precision and recall for extraction and classifi cation</p><p>LLM-as-judge where it helps</p><p>regression tests whenever prompts or models change</p><p>Keep cost and latency under control on self-hosted, open-weight models.</p><p>Work with the business users who defi ne the criteria, and turn their feedback into measurableimprovements.</p> </div><h2 class="h5">Skills</h2>
<div data-jb-field="skills"><p>Must have</p><p>6+ years of software engineering, including 1+ year building LLM-powered applications.</p><p>Hands-on experience with</p><p>document processing</p><p>: parsing, OCR, and layout analysis (e.g.Docling, Unstructured, Tesseract, or similar).</p><p>Experience building extraction, classifi cation, or ranking systems, and measuring their accuracy.</p><p>Strong</p><p>Python</p><p>.</p><p>Working knowledge of the core AI topics below.</p><p>Nice to have</p><p>Arabic NLP, or experience with multilingual documents.</p><p>Vision-language models for document understanding.</p><p>Vector search and RAG (e.g. pgvector, Qdrant, OpenSearch).</p><p>Fine-tuning small models for extraction or classifi cation.</p><p>Learning-to-rank or recommendation systems.</p><p>Core AI knowledge</p><p>We expect every AI Engineer on our team to be able to discuss these topics with confi dence. For this rolewe expect depth in LLM fundamentals and evaluation, and working knowledge of the rest.</p><p>How LLMs work:</p><p>the Transformer architecture, tokenisation (and how it affects Arabic text),decoding and sampling, the training pipeline (pre-training, SFT, RLHF / DPO, RL with verifi ablerewards), long-context limits, and common failure modes such as hallucination and promptinjection.</p><p>Agentic AI:</p><p>agent patterns (ReAct, plan-and-execute, refl ection), tool design, context engineering(retrieval, memory, compaction), and safety controls.</p><p>Protocols:</p><p>Model Context Protocol (MCP) and Agent2Agent (A2A).</p><p>Agent harnesses:</p><p>what sits around the model (the loop, tools, permissions, context management),and hands-on experience with at least one agent framework or SDK.</p><p>Behavioural vs procedural approaches:</p><p>when to let the model decide the steps and when todefi ne them in code, and how to combine the two.</p><p>Benchmarks:</p><p>what current benchmarks measure and miss, and how to read results critically.</p></div>
<h2 class="h5">الوصف الوظيفي</h2><div class="t-break" data-jb-field="description"><p>بناء أنابيب معالجة (pipelines) لمعالجة كميات كبيرة من المستندات (ملفات PDF وWord وExcel والملفات الممسوحة ضوئيًا، باللغتين الإنجليزية والعربية) وتحويلها إلى بيانات نظيفة ومنظمة.</p><p>استخدام النماذج اللغوية الكبيرة (LLMs) ونماذج الرؤية واللغة لاستخراج التفاصيل الرئيسية إلى مخططات محددة (مخرجات منظمة).</p><p>تصنيف المستندات وترتيبها وفقًا لمعايير محددة من قبل الأعمال، وشرح سبب منح كل ترتيب.</p><p>بناء أنظمة استرجاع المعلومات من مجموعات المستندات لتمكين المستخدمين والوكلاء من البحث وطرح الأسئلة.</p><p>بناء أنظمة التقييم:</p><p>مجموعات اختبار معنونة (labelled test sets)</p><p>الدقة (precision) والاستدعاء (recall) للاستخراج والتصنيف</p><p>استخدام النموذج اللغوي الكبير كحكم (LLM-as-judge) عند الحاجة</p><p>اختبارات الانحدار (regression tests) كلما تغيرت المحثات أو النماذج</p><p>التحكم في التكلفة وزمن الاستجابة على النماذج المفتوحة الأوزان والمستضافة ذاتيًا.</p><p>العمل مع مستخدمي الأعمال الذين يحددون المعايير، وتحويل ملاحظاتهم إلى تحسينات قابلة للقياس.</p></div><h2 class="h5">المهارات</h2><div data-jb-field="skills"><p>المهارات الأساسية المطلوبة</p><p>خبرة أكثر من 6 سنوات في هندسة البرمجيات، بما في ذلك أكثر من سنة في بناء تطبيقات مدعومة بالنماذج اللغوية الكبيرة (LLMs).</p><p>خبرة عملية في</p><p>معالجة المستندات</p><p>: التحليل اللغوي (parsing)، والتعرف الضوئي على الحروف (OCR)، وتحليل التخطيط (مثل Docling أو Unstructured أو Tesseract أو ما يماثلها).</p><p>خبرة في بناء أنظمة الاستخراج أو التصنيف أو الترتيب، وقياس دقتها.</p><p>إتقان قوي لـ</p><p>بايثون</p><p>.</p><p>معرفة عملية بمواضيع الذكاء الاصطناعي الأساسية أدناه.</p><p>ميزات إضافية يُفضل وجودها</p><p>معالجة اللغة الطبيعية للغة العربية (Arabic NLP)، أو خبرة في التعامل مع المستندات متعددة اللغات.</p><p>نماذج الرؤية واللغة لفهم المستندات.</p><p>البحث الاتجاهي (Vector search) والتوليد المعزز بالاسترجاع (RAG) (مثل pgvector، Qdrant، OpenSearch).</p><p>الضبط الدقيق (Fine-tuning) للنماذج الصغيرة لأغراض الاستخراج أو التصنيف.</p><p>أنظمة التعلم للترتيب (Learning-to-rank) أو أنظمة التوصية.</p><p>المعرفة الأساسية بالذكاء الاصطناعي</p><p>نتوقع من كل مهندس ذكاء اصطناعي في فريقنا أن يكون قادرًا على مناقشة هذه المواضيع بثقة. بالنسبة لهذا الدور، نتوقع تعمقًا في أساسيات النماذج اللغوية الكبيرة وتقييمها، ومعرفة عملية بباقي المواضيع.</p><p>كيفية عمل النماذج اللغوية الكبيرة:</p><p>معمارية الترانسفورمر (Transformer)، والترميز (tokenisation) (وكيف يؤثر على النص العربي)، وفك الترميز وأخذ العينات، وأنبوب التدريب (التدريب المسبق، SFT، RLHF / DPO، التعلم المعزز مع المكافآت القابلة للتحقق)، وحدود السياق الطويل، وأنماط الفشل الشائعة مثل الهلوسة وحقن المحثات (prompt injection).</p><p>الذكاء الاصطناعي القائم على الوكلاء (Agentic AI):</p><p>أنماط الوكلاء (ReAct، التخطيط والتنفيذ، والتأمل)، تصميم الأدوات، هندسة السياق (الاسترجاع، الذاكرة، الضغط)، وضوابط الأمان.</p><p>البروتوكولات:</p><p>بروتوكول سياق النموذج (MCP) وبروتوكول Agent2Agent (A2A).</p><p>أطر حماية وتشغيل الوكلاء (Agent harnesses):</p><p>المكونات المحيطة بالنموذج (الحلقة، الأدوات، الأذونات، إدارة السياق)، وخبرة عملية مع إطار عمل وكلاء واحد على الأقل أو حزمة تطوير برمجيات (SDK).</p><p>النهج السلوكي مقابل النهج الإجرائي:</p><p>متى تترك للنموذج قرار تحديد الخطوات ومتى تحددها في الكود، وكيفية الجمع بين الاثنين.</p><p>معايير التقييم (Benchmarks):</p><p>ما تقيسه المعايير الحالية وما تغفله، وكيفية قراءة النتائج بنقد وتحليل.</p></div>