पाठ 21 / 25
जो मायने रखता है उसकी निगरानी
Consumer lag, under-replicated partitions, request latency और disk उपयोग ट्रैक करें।
चार संकेत
पहले इन पर alert लगाएँ: (1) प्रति group consumer lag (बढ़ता lag मतलब consumers साथ नहीं चल पा रहे; समय के रूप में lag भी देखें); (2) under-replicated partitions और offline partitions (शून्य से ज़्यादा का मतलब डेटा जोखिम में या अनुपलब्ध); (3) producers और brokers पर request latency और error दरें, और ISR shrink/expand घटनाएँ; (4) brokers पर disk उपयोग और network, क्योंकि भरी disk broker रोक देती है। JMX metrics को Prometheus/Grafana में export करें या managed monitoring service उपयोग करें, और सिर्फ़ तात्कालिक मान नहीं, lag के रुझान देखें।
देखें, सुरक्षित करें, बढ़ाएँ
Production cluster को monitoring, access control और क्षमता व upgrades की योजना चाहिए।
Groups और under-replicated partitions जाँचना
दोनों commands Kafka के साथ आते हैं। --under-replicated-partitions का ख़ाली नतीजा स्वस्थ है। (असली cluster के लिए उदाहरण; lag output का format पहले दिखाया गया।)
kafka-consumer-groups.sh --bootstrap-server broker1:9092 --describe --group billing
kafka-topics.sh --bootstrap-server broker1:9092 --describe --under-replicated-partitions
kafka-topics.sh --bootstrap-server broker1:9092 --describe --unavailable-partitionsसिर्फ़ आकार नहीं, lag की वृद्धि पर alert
10,000 का lag batch consumer के लिए ठीक और payments consumer के लिए संकट हो सकता है। जब lag कई मिनट बढ़ता रहे तब alert करें, हर consumer के अलग thresholds के साथ।
त्वरित जाँच: Under-replicated partition संख्या शून्य से ज़्यादा होना क्या दर्शाता है?
- Cluster निष्क्रिय है
- कुछ replicas साथ नहीं चल पा रहे, इसलिए durability घटी है
- Consumers बहुत तेज़ हैं
- Compression बंद है
Answer
कुछ replicas साथ नहीं चल पा रहे, इसलिए durability घटी है — इसका मतलब replication factor से कम in-sync copies हैं, जिस पर ध्यान चाहिए।