مانیتورینگ؛
قبل از کاربر، مشکل را ببینید
متریک، لاگ و هشدار در یک داشبورد یکپارچه، تا تیم شما قبل از اینکه مشتری تماس بگیرد، بداند چه اتفاقی افتاده و چرا.
Uptime
→ پایدار
p99 Latency
↓ بهبود
Error Rate
↓ بهبود
Active Alerts
↑ توجه
request latency، last 24h
مشکل را قبل از تیکت پشتیبانی ببینید
سیستم ما الگوهای anomaly را شناسایی میکند، نه فقط threshold ساده. یعنی مشکلات تدریجی و غیرمنتظره هم کشف میشوند.
میانگین زمان تشخیص تا اعلان به تیم
API latency > 2s، order-service
۲ دقیقه پیش
Disk usage ۸۵٪، db-primary
۱۴ دقیقه پیش
Deploy v2.4.1، production
۱ ساعت پیش
هر شاخص حیاتی، قابل اندازهگیری
متریکهای عملکرد
- Latency p99
- Throughput RPS
- Error rate
متریکهای زیرساخت
- CPU / RAM
- Disk I/O
- Network
متریکهای کسبوکار
- سفارش موفق
- ثبتنام
- پرداخت
هشدار درست، به فرد درست، در زمان درست
alert fatigue یعنی تیم هشدارها را نادیده میگیرد. ما قوانین هشدار را دقیق تنظیم میکنیم.
// Loki query: {app="order-service"} |= "error"
2024-06-11T14:32:01Z ERROR payment timeout order_id=8842
2024-06-11T14:31:58Z WARN retry attempt 2/3 gateway=stripe
2024-06-11T14:31:55Z INFO order created order_id=8842
2024-06-11T14:31:52Z DEBUG cache hit user_id=1204
→ 4 results · 12ms
همه لاگها، یک جستجو
دیگر نیازی به SSH به ده سرور مختلف نیست. همه لاگها در یک جا جمع، ایندکس و قابل جستجو هستند.
Application logs
۲.۴M/day
Nginx access
۸.۱M/day
PostgreSQL slow query
۱۲K/day
Security audit
۴۵K/day
فرهنگ پایداری، نه فقط ابزار
ابزار بدون فرهنگ SRE، فقط داشبورد زیباست. ما هر دو را با هم پیاده میکنیم.
تعریف SLO
هدف قابل اندازهگیری برای uptime و latency، نه وعده مبهم ۹۹.۹٪
Error Budget
وقتی بودجه خطا تمام شد، feature freeze تا پایداری برگردد
Postmortem بدون مقصر
هر حادثه، درس سازمانی، نه سرزنش فردی
Chaos Engineering
تست مقاومت قبل از حادثه واقعی، نه بعد از آن
Runbook خودکار
پاسخ به حادثههای تکراری بدون دخالت انسانی
گزارش SLA
گزارش ماهانه شفاف برای مدیریت و مشتریان
سوالات فنی درباره مانیتورینگ و Observability
مانیتورینگ سنتی فقط میگوید «چیزی خراب شده». Observability میگوید «چرا خراب شده»، با ترکیب متریک، لاگ و تریس میتوانید علت ریشهای را بدون حدس زدن پیدا کنید.
استک پیشفرض ما Prometheus برای متریک، Grafana برای داشبورد، Loki برای لاگ و Alertmanager برای هشدار است. اما ابزار را با زیرساخت و بودجه شما همراستا میکنیم، Datadog، ELK یا CloudWatch هم گزینههای معتبر هستند.
بله. ابتدا وضعیت فعلی را ممیزی میکنیم، شاخصهای حیاتی (SLI/SLO) را تعریف میکنیم و سپس ابزارها را مرحلهبهمرحله نصب میکنیم، بدون توقف سرویس.
از طریق Slack، Microsoft Teams، ایمیل، SMS یا PagerDuty، هر کدام که تیم شما استفاده میکند. هشدارها طبق شدت و زمانبندی (ساعات کاری / ۲۴ ساعته) مسیریابی میشوند تا alert fatigue ایجاد نشود.
داشبورد اولیه با متریکهای حیاتی معمولا در ۲ هفته آماده است. سیستم کامل با لاگ، هشدار و SLO معمولا بین ۴ تا ۶ هفته، بسته به تعداد سرویسها و پیچیدگی زیرساخت.
بله. دادهها در زیرساخت شما یا محیط ابری اختصاصی نگهداری میشوند. دسترسی با RBAC کنترل میشود و داده حساس (مثل لاگ حاوی اطلاعات کاربر) قبل از ذخیره mask میشود.
بسته به تعداد سرویسها، حجم داده و ابزار انتخابی متفاوت است. بعد از ممیزی زیرساخت، برآورد شفاف ارائه میدهیم. هزینه downtime یک حادثه بدون مانیتورینگ، معمولا چندین برابر هزینه راهاندازی است.
الان چقدر از سیستمتان دید دارید؟
در یک جلسه ۴۵ دقیقهای، شکافهای مانیتورینگ فعلی را شناسایی میکنیم و نقشه راه Observability، شامل ابزار، SLO و برآورد هزینه، را مکتوب تحویل میدهیم.
درخواست ممیزی مانیتورینگ
پاسخ در کمتر از ۲۴ ساعت کاری
سامانه جامع سفارشگیری
خدمت را انتخاب کنید، پروژه را پیکربندی کنید، قرارداد را امضا کنید و آنلاین پرداخت کنید.
خدمت انتخابی: مانیتورینگ
انتخاب خدمت
نوع پروژه و پکیج مناسب
پیکربندی
ماژولها، زمانبندی و جزئیات
قرارداد آنلاین
امضای دیجیتال و شفافیت کامل
پرداخت امن
تسویه آنلاین و شروع پروژه
- برآورد قیمت لحظهای
- قرارداد و فاکتور رسمی
- پیگیری آنلاین پروژه
دید کامل، قبل از فاجعه
Observability که تیم شما را از حدس به اطمینان میرساند.