وصف
الملخص:
يُكفل مهندس موثوقية الموقع موثوقية النظام وقابليته للتوسع وأدائه من خلال تطبيق هندسة البرمجيات على العمليات، وبناء أنظمة الأتمتة، وتحسين استجابة الحوادث وقدرة المراقبة.
أبرز النقاط:
1. ضمان موثوقية الأنظمة الإنتاجية وقابليتها للتوسع وأدائها
2. تصميم البنية التحتية الإنتاجية والأتمتة وبناؤها والحفاظ عليها
3. قيادة استجابة الحوادث واتخاذ الإجراءات التصحيحية
**مهندس موثوقية الموقع (SRE) — الوصف الوظيفي**
**نظرة عامة**
* ضمان موثوقية الأنظمة الإنتاجية وقابليتها للتوسع وأدائها من خلال تطبيق هندسة البرمجيات على العمليات، وبناء أنظمة الأتمتة، وتحسين استجابة الحوادث وقدرة المراقبة.
**المسؤوليات الرئيسية**
* تصميم البنية التحتية الإنتاجية والأتمتة وأدوات المنصة وبناؤها والحفاظ عليها لتقليل المهام الروتينية وتحسين الموثوقية.
* تحديد مؤشرات أداء مستوى الخدمة (SLOs) ومؤشرات مستوى الخدمة (SLIs) وتتبعها، وقياس ميزانيات الخطأ، واتخاذ إجراءات التصحيح لتحقيق أهداف التوافر.
* تنفيذ خطوط أنابيب التكامل المستمر/النشر المستمر (CI/CD) والمحافظة عليها، وأتمتة عمليات النشر واستراتيجيات الإصدار (مثل النشر الأزرق/الأخضر أو النشر التدريجي).
* بناء أنظمة المراقبة والتسجيل والتتبع والإشعارات؛ وإنشاء لوحات المعلومات والتعليمات التشغيلية (Runbooks) لفرق الاستدعاء على مدار الساعة.
* قيادة استجابة الحوادث، وتنسيق المراجعات اللاحقة للحوادث (تحليل الجذور السببية أو التحليل غير التجريحي بعد الحوادث)، واتخاذ الإجراءات التصحيحية.
* إجراء تخطيط السعة، وضبط الأداء، وتحسين استخدام الموارد للخدمات والبنية التحتية.
* إدارة ومناولة منصات تنسيق الحاويات (Kubernetes/EKS/GKE/AKS) والخدمات الداعمة لها.
* أتمتة إعداد الموارد وتكوينها باستخدام نهج البنية التحتية كرمز (IaC) مثل Terraform وCloudFormation وAnsible، وإدارة الأسرار والتكوين بأمان.
* تنفيذ معمارية مقاومة للأعطال، واستراتيجيات استعادة الكوارث، والاستراتيجيات الاحتياطية، وتصاميم متعددة المناطق.
* التعاون مع المطورين لتحسين قابلية المراقبة والموثوقية والاستعداد التشغيلي للخدمات.
* تأمين الأنظمة بما يحقق المتطلبات الأمنية ومتطلبات الامتثال؛ وتنفيذ تحديثات التصحيح وفحص الثغرات والرقابة على الوصول.
* توجيه الفرق الهندسية بشأن أفضل الممارسات في مجال الموثوقية والمساهمة في ثقافة مهندسي موثوقية الموقع (SRE) وأدواتها.
**المهارات والمؤهلات المطلوبة**
* خبرة تتراوح بين ٣–٦ سنوات فأكثر في مجال مهندسي موثوقية الموقع (SRE) أو DevOps أو هندسة العمليات الإنتاجية (مع تعديل المدة حسب المستوى المطلوب).
* خبرة قوية في منصات السحابة (AWS وGCP وAzure) والخدمات المُدارة.
* إتقان تقنيات الحاويات والتنسيق (Docker وKubernetes) والأدوات المرتبطة بها (مثل Helm، مع إمكانية وجود Istio/Linkerd).
* خبرة في نهج البنية التحتية كرمز (Terraform وCloudFormation) وإدارة التكوين.
* مهارات بارعة في البرمجة والكتابة النصية (Python وGo وBash) لأتمتة العمليات وتطوير الأدوات.
* معرفة بأنظمة المراقبة الشاملة (مثل Prometheus وGrafana وDatadog وELK/Opensearch وJaeger/Zipkin).
* فهم عميق لشبكات الحاسوب وتوزيع الأحمال والتخزين وتفاصيل أنظمة التشغيل (خاصة Linux).
* خبرة في تنفيذ أنظمة التكامل المستمر/النشر المستمر (مثل GitHub Actions وJenkins وGitLab CI) وأتمتة عمليات الإصدار.
* خبرة مثبتة في إدارة الحوادث والقدرة على العمل تحت الضغط.
* مهارات قوية في التعاون والتواصل وإعداد الوثائق.
**المزايا التفضيلية**
* خبرة في وضع أطر مؤشرات أداء مستوى الخدمة (SLO) ومستوى اتفاقيات الخدمة (SLA) ودفع عملية اعتمادها على نطاق المؤسسة.
* خلفية في الأنظمة الموزعة أو الخدمات الإنتاجية ذات النطاق الواسع أو هندسة المنصات.
* خبرة في هندسة الفوضى (Chaos Engineering) أو حقن الأعطال أو اختبار المرونة.
* معرفة بمفهوم السياسات كرمز (Policy-as-Code) مثل OPA وSentinel، وشبكات الخدمات (Service Meshes)، وسير عمل GitOps.
* شهادات معتمدة (مثل CKA أو شهادات AWS/Azure/GCP) أو مساهمات في أدوات مفتوحة المصدر لمجال مهندسي موثوقية الموقع (SRE).
الراتب: ١٥٬٣٢١٫٤٤ ر.ق. – ٢٢٬٢١٤٫٠٩ ر.ق. شهريًا
موقع العمل: حضوري