Amazon EKS API Server கண்காணிப்பு
Observability சிறந்த நடைமுறைகள் வழிகாட்டியின் இந்தப் பிரிவில், API Server கண்காணிப்பு தொடர்பான பின்வரும் தலைப்புகளை ஆழமாக ஆராய்வோம்:
- Amazon EKS API Server கண்காணிப்பு அறிமுகம்
- API Server Troubleshooter Dashboard அமைத்தல்
- API Server சிக்கல்களைப் புரிந்துகொள்ள API Troubleshooter Dashboard பயன்படுத்துதல்
- API Server க்கு Unbounded list calls புரிந்துகொள்ளுதல்
- API Server க்கு தவறான நடத்தையை நிறுத்துதல்
- API Priority and Fairness
- மெதுவான API calls மற்றும் API Server Latency சிக்கல்களை அடையாளம் காணுதல்
அறிமுகம்
உங்கள் Amazon EKS managed control plane ஐ கண்காணிப்பது உங்கள் EKS cluster இன் நலனில் உள்ள சிக்கல்களை முன்கூட்டியே அடையாளம் காண மிக முக்கியமான Day 2 செயல்பாட்டு நடவடிக்கையாகும். Amazon EKS Control plane கண்காணிப்பு சேகரிக்கப்பட்ட metrics அடிப்படையில் முன்னெச்சரிக்கை நடவடிக்கைகளை எடுக்க உதவுகிறது. இந்த metrics API servers ஐ பிழைகாணவும், உள்ளே இருக்கும் சிக்கலை துல்லியமாக கண்டறியவும் உதவும்.
இந்தப் பிரிவில் Amazon EKS API server கண்காணிப்புக்காக Amazon Managed Service for Prometheus (AMP) ஐயும், metrics காட்சிப்படுத்தலுக்காக Amazon Managed Grafana (AMG) ஐயும் நிரூபணத்திற்கு பயன்படுத்துவோம். Prometheus என்பது சக்திவாய்ந்த query திறன்களை வழங்கும் மற்றும் பல்வேறு workloads க்கு பரந்த ஆதரவை கொண்ட பிரபலமான open source கண்காணிப்பு கருவியாகும். Amazon Managed Service for Prometheus என்பது Amazon EKS, Amazon Elastic Container Service (Amazon ECS), மற்றும் Amazon Elastic Compute Cloud (Amazon EC2) போன்ற சூழல்களை பாதுகாப்பாகவும் நம்பகமாகவும் கண்காணிப்பதை எளிதாக்கும் முழுமையாக நிர்வகிக்கப்படும் Prometheus-இணக்கமான சேவையாகும். Amazon Managed Grafana என்பது open source Grafana க்கான முழுமையாக நிர்வகிக்கப்படும் மற்றும் பாதுகாப்பான தரவு காட்சிப்படுத்தல் சேவையாகும், இது வாடிக்கையாளர்களுக்கு பல தரவு மூலங்களிலிருந்து அவர்களது பயன்பாடுகளுக்கான operational metrics, logs, மற்றும் traces ஐ உடனடியாக query செய்ய, தொடர்புபடுத்த மற்றும் காட்சிப்படுத்த உதவுகிறது.
முதலில் Amazon Managed Service for Prometheus மற்றும் Amazon Managed Grafana ஐ பயன்படுத்தி Amazon Elastic Kubernetes Service (Amazon EKS) API Servers ஐ Prometheus மூலம் பிழைகாண உதவும் ஒரு starter dashboard அமைப்போம். EKS API Servers ஐ பிழைகாணும்போது சிக்கல்களைப் புரிந்துகொள்வது, API priority and fairness, தவறான நடத்தைகளை நிறுத்துதல் ஆகியவற்றைப் பற்றி வரவிருக்கும் பிரிவுகளில் ஆழமாக ஆராய ்வோம். இறுதியாக, மிகவும் மெதுவான API calls மற்றும் API server latency சிக்கல்களை அடையாளம் காணுதலில் ஆழமாக ஆராய்வோம், இது நமது Amazon EKS cluster ஐ ஆரோக்கியமான நிலையில் வைத்திருக்க நடவடிக்கைகள் எடுக்க உதவும்.
API Server Troubleshooter Dashboard அமைத்தல்
AMP மூலம் Amazon Elastic Kubernetes Service (Amazon EKS) API Servers ஐ பிழைகாண உதவும் ஒரு starter dashboard அமைப்போம். உங்கள் production EKS clusters ஐ பிழைகாணும்போது metrics ஐ புரிந்துகொள்ள இதைப் பயன்படுத்துவோம். உங்கள் Amazon EKS clusters ஐ பிழைகாணும்போது சேகரிக்கப்பட்ட metrics இன் முக்கியத்துவத்தை புரிந்துகொள்ள மேலும் ஆழமாக கவனம் செலுத்துவோம்.
முதலில், உங்கள் Amazon EKS cluster இலிருந்து Amazon Managed Service for Prometheus க்கு metrics சேகரிக்க ADOT collector அமைக்கவும். இந்த அமைப்பில் EKS ADOT Addon ஐ பயன்படுத்துவீர்கள், இது EKS cluster இயங்கிய பிறகு எந்த நேரத்திலும் ADOT ஐ add-on ஆக இயக்க அனுமதிக்கிறது. ADOT add-on சமீபத்திய பாதுகாப்பு patches மற்றும் bug fixes ஐ உள்ளடக்கியது மற்றும் Amazon EKS உடன் வேலை செய்ய AWS ஆல் சரிபார்க்கப்பட்டது. இந்த அமைப்பு EKS cluster இல் ADOT add-on ஐ எவ்வாறு நிறுவுவது மற்றும் அதை உங்கள் cluster இலிருந்து metrics சேகரிக்க எவ்வாறு பயன்படுத்துவது என்பதைக் காண்பிக்கும்.
அடுத்து, முதல் படியில் அமைத்த AMP ஐ data source ஆகப் பயன்படுத்தி metrics காட்சிப்படுத்த உங்கள் Amazon Managed Grafana workspace ஐ அமைக்கவும். இறுதியாக API troubleshooter dashboard ஐ பதிவிறக்கம் செய்து, மேலும் பிழைகாணலுக்கு metrics ஐ காட்சிப்படுத்த API troubleshooter dashboard json ஐ பதிவேற்ற Amazon Managed Grafana க்கு செல்லவும்.
சிக்கல்களைப் புரிந்துகொள்ள API Troubleshooter Dashboard பயன்படுத்துதல்
நீங்கள் உங்கள் cluster இல் நிறுவ விரும்பிய ஒரு சுவாரஸ்யமான open-source project ஐ கண்டுபிடித்தீர்கள் என்று வைத்துக்கொள்வோம். அந்த operator உங்கள் cluster க்கு ஒரு DaemonSet ஐ deploy செய்கிறது, அது தவறான requests, தேவையில்லாமல் அதிக அளவிலான LIST calls, அல்லது உங்கள் 1,000 nodes முழுவதிலும் உள்ள ஒவ்வொரு DaemonSets ஒவ்வொரு நிமிடமும் உங்கள் cluster இல் உள்ள அனைத்து 50,000 pods இன் நிலையை கோரலாம்! இது அடிக்கடி நடக்கிறதா? ஆம், நடக்கிறது! இது எவ்வாறு நிகழ்கிறது என்பதை விரைவாகப் பார்ப்போம்.