Live:CloudOps Webinars & Hands-on Workshops ·Register ↗
Skip to main content

சைட் நம்பகத்தன்மை பொறியாளர்கள்

சைட் நம்பகத்தன்மை பொறியியல் (SRE) என்பது மென்பொருள் கணினிகளின் நம்பகத்தன்மை மற்றும் செயல்திறனை மேம்படுத்துவதில் கவனம் செலுத்தும் ஒரு மென்பொருள் பொறியியல் நடைமுறையாகும். SRE-இன் முக்கிய இலக்குகளில் ஒன்று கிடைக்கும் தன்மை, செயல்திறன், தாமதம், திறன், திறனாற்றல் மற்றும் சம்பவ பதில் போன்ற பகுதிகளில் மென்பொருள் கணினி நம்பகத்தன்மையை மேம்படுத்துவதாகும். SRE குழுக்கள் தங்கள் இலக்குகளுக்கு எதிராக சரிபார்க்க அளவிடும் சில மெட்ரிக்குகள் Service Level Agreements (SLA), Service Level Objectives (SLO), Service Level Indicators (SLI) மற்றும் Error budgets ஆகும்.

உங்கள் observability உத்தியை வழிநடத்த SRE கவனம் செலுத்தும் பகுதிகள் மற்றும் சிறந்த நடைமுறைகள் கீழே உள்ளன.

சம்பவ பதில் மற்றும் நெருக்கடி மேலாண்மை

சம்பவ பதில் என்பது திட்டமிடப்படாத நிகழ்வுகள் அல்லது இடையூறுகளை கண்காணித்தல், கண்டறிதல் மற்றும் எதிர்வினையாற்றுதல் ஆகியவற்றை உள்ளடக்கியது, சம்பவத்தை தீர்க்கும் சராசரி நேரத்தை (MTTR) குறைப்பதும் service level agreements (SLAs)-ஐ திருப்திப்படுத்துவதும் இலக்காகும்.

சம்பவ பதில் மற்றும் நெருக்கடி மேலாண்மையில் சில சிறந்த நடைமுறைகள்:

  • சம்பவம் குறைந்தபட்ச நேரத்தில் தணிக்கப்படுவதையும் மேலும் தாக்கம் தவிர்க்கப்படுவதையும் உறுதி செய்ய விரைவான கண்டறிதல், பதில் மற்றும் கட்டுப்படுத்தல் முக்கியமானது.

  • பயனுள்ள சம்பவ தணிப்புக்காக on-call schedules-ஐ ஒழுங்குபடுத்தி செயல்பாட்டு runbooks-ஐ உள்ளடக்கிய வலுவான on-call கணினியை கட்டியெழுப்புங்கள்.

  • பயனுள்ள சம்பவ-பிறகு பகுப்பாய்வு செயல்முறையை கட்டியெழுப்புங்கள். ஒரு மூல காரண பகுப்பாய்வு பொதுவாக பின்வருவனவற்றை உள்ளடக்க வேண்டும்

    • தாக்க பகுப்பாய்வு - இந்த சம்பவத்தால் என்ன கணினிகள், உள் செயல்முறைகள், இறுதிப் பயனர்கள் பாதிக்கப்பட்டனர் என்பதையும், இது ஏதேனும் நிதி தாக்கத்தை ஏற்படுத்தியிருக்கலாம் என்பதையும் அடையாளம் காணுங்கள்.

    • மூல காரணம் & தீர்வு - நிகழ்வின் மூல காரண பகுப்பாய்வை நடத்தி, எதிர்காலத்தில் சூழ்நிலை மீண்டும் நிகழாமல் தடுக்க guardrails-ஐ செயல்படுத்த வாய்ப்புகளை அடையாளம் காணுங்கள்.

    • கண்காணிப்பு மற்றும் எச்சரிக்கை - அமைக்கப்பட்ட மெட்ரிக் மற்றும் alarm thresholds சரியான சிக்னல்களை அறிவிக்கிறதா என்பதையும், சாத்தியமான சம்பவத்தை தடுப்பதற்கான வாய்ப்பு உள்ளதா என்பதையும் அடையாளம் காணுங்கள்.

    • நடவடிக்கை பொருட்கள் & கற்றல் - நடவடிக்கை பொருட்களுக்கு உரிமையாளர்களை நியமித்து அவற்றைத் தொடருங்கள். எதிர்கால தோல்விகளைத் தவிர்க்க சம்பவத்திலிருந்து கற்றவை தயாரிப்பு வாழ்க்கைச் சுழற்சியில் உள்ளமைக்கப்படும் பின்னூட்ட வழிமுறையை நிறுவுவது முக்கியம்.

சேவை-நிலை இலக்குகள் மற்றும் முக்கிய மெட்ரிக்குகள்

SLIs (Service Level Indicators) உண்மையான அளவீடுகள்/மெட்ரிக்குகள் ஆகும். எடுத்துக்காட்டுகள்: மில்லிவினாடிகளில் பதில் நேரம், கணினி இயங்கு நேர சதவீதம், ஒரு மில்லியன் கோரிக்கைகளுக்கான பிழை விகிதம், வினாடிக்கான கோரிக்கைகளில் throughput, வள பயன்பாடு (CPU, நினைவகம், முதலியன)

SLOs (Service Level Objectives) SLIs-ஐ பயன்படுத்தி அமைக்கப்பட்ட இலக்கு இலக்குகள் ஆகும். அவை "நல்ல சேவை" என்றால் என்ன என்பதை வரையறுக்கின்றன. 95% கோரிக்கைகள் 200ms-க்குள் முடிவடையும், மாதத்திற்கு 99.9% இயங்கு நேரம், 30 நாட்களில் 0.1%-க்கு கீழ் பிழை விகிதம் போன்ற எடுத்துக்காட்டுகள். SLIs மற்றும் SLOs இடையிலான உறவை கீழே வரையறுக்கலாம்

SLI (மெட்ரிக்) + இலக்கு + நேர சாளரம் = SLO எடுத்துக்காட்டு: பதில் நேரம் (SLI) + 200ms-க்கு கீழ் + 30 நாட்களில் அளவிடப்படும் = SLO

SLIs மற்றும் SLOs-க்கான சிறந்த நடைமுறைகள் கீழே

  • SLOs-க்கு SMART கட்டமைப்பை நிறுவுங்கள்

    • Specific: தெளிவான மெட்ரிக் மற்றும் threshold ("200ms-க்கு கீழ் பதில் நேரம்").
    • Measurable: கண்காணிப்பு கருவிகளால் கண்காணிக்க முடியும்.
    • Achievable: கணினி திறன்களின் அடிப்படையில் யதார்த்தமானது.
    • Relevant: பயனர் அனுபவத்திற்கு முக்கியமானது.
    • Time-bound: வரையறுக்கப்பட்ட காலத்தில் (உதா., 30 நாட்கள்) அளவிடப்படுகிறது.
  • பயனர் அனுபவத்தை நேரடியாக பாதிக்கும் SLIs-ஐ தேர்வு செய்யுங்கள்.

  • வணிக தேவைகளின் அடிப்படையில் யதார்த்தமான SLO இலக்குகளை அமைக்கவும்.

  • வழக்கமான கண்காணிப்பு மற்றும் சரிசெய்தல்.

  • தெளிவான ஆவணப்படுத்தல் மற்றும் தகவல் தொடர்பு.

  • தேவைப்பட்டால் வெவ்வேறு சேவை அடுக்குகளுக்கு வெவ்வேறு SLOs வைக்கவும்.

  • முக்கிய மெட்ரிக்குகளை அடையாளம் காணுங்கள்

    • தாமதம்: ஒரு கணினி கோரிக்கைக்கு பதிலளிக்க எடுக்கும் நேரத்தை அளவிடுங்கள், வெற்றிகரமான மற்றும் பிழை தாமதங்கள் இரண்டையும் கண்காணிக்கவும்.
    • போக்குவரத்து: கணினி வழியாக செல்லும் கோரிக்கைகள் அல்லது தரவின் அளவை கண்காணித்து பயன்பாட்டு முறைகளையும் அளவு தேவைகளையும் புரிந்துகொள்ளவும்.
    • பிழைகள்: கணினிக்குள் நிகழும் பிழைகளின் அதிர்வெண் மற்றும் வகைகளைக் கண்காணிக்கவும்.
    • நிறைவு: சாத்தியமான தடைகளை அடையாளம் காண CPU மற்றும் நினைவகம் போன்ற முக்கிய வளங்களின் பயன்பாட்டை கண்காணிக்கவும்.

இங்கே ஒரு எடுத்துக்காட்டு SLO ஆவணம்

Service: User Authentication API SLO: 99.9% of authentication requests will complete in under 500ms Measurement Window: Rolling 30-day period SLI: Response time measured at server Exclusions: Planned maintenance windows

திறன் திட்டமிடல் மற்றும் அளவிடுதல்

திறன் திட்டமிடல் மற்றும் நிகழ்வு தயார்நிலை கணினி நம்பகத்தன்மையை உறுதி செய்வதற்கான இன்றியமையாத கூறுகள் ஆகும்.

சில சிறந்த நடைமுறைகள்

  • எதிர்பார்க்கப்படும் பயனர் போக்குவரத்து முறைகள், பயனர்களின் புவியியல் விநியோகம், இலக்கு AWS regions, நிகழ்வின் உச்ச நேரம் போன்ற முக்கிய கூறுகளை உள்ளடக்கிய விரிவான நிகழ்வுகள் நாட்காட்டியை செயல்படுத்துங்கள்.

  • கணினி அளவிடுதல் சரிபார்ப்பு, செயல்திறன் அளவுகோல் மற்றும் திறன் threshold சோதனை ஆகியவற்றை உள்ளடக்கிய நிகழ்வு தயார்நிலை சோதனையை நடத்துங்கள்.

  • காப்பு மற்றும் மீட்பு நடைமுறைகள், region switch over runbooks, சம்பவ பதில் நெறிமுறைகள், தணிப்பு நடைமுறைகள் போன்ற failover வழிமுறைகளை சரிபார்க்கவும்.

உள்கட்டமைப்பு மேலாண்மைக்கான ஆட்டோமேஷன் மற்றும் ஸ்கிரிப்டிங்

ஆட்டோமேஷன் உள்கட்டமைப்பின் திறமையான செயல்பாட்டிற்கு முக்கியமானது. ஆட்டோமேஷன் அதிக நம்பகமான, அளவிடக்கூடிய மற்றும் திறமையான உள்கட்டமைப்பை உருவாக்குகிறது, அதே நேரத்தில் குழுக்களை வழக்கமான பராமரிப்பிற்குப் பதிலாக மூலோபாய முயற்சிகளில் கவனம் செலுத்த விடுவிக்கிறது. ஆட்டோமேஷனின் சில நன்மைகள்

  • சிறிய அல்லது எந்த மனித தலையீடும் இல்லாமல் கணினிகளின் மேம்படுத்தப்பட்ட நம்பகத்தன்மை.

  • போக்குவரத்து மற்றும் தேவைக்கு ஏற்ப பயன்பாட்டை தானாக அளவிட அனுமதிக்கும் மேம்படுத்தப்பட்ட அளவிடுதல்.

  • விரைவான & தானியங்கு சம்பவ தீர்வு, குறைக்கப்பட்ட பிழை விகிதங்கள் மற்றும் மேம்படுத்தப்பட்ட MTBF (தோல்விகளுக்கு இடையிலான சராசரி நேரம்).

  • குறைக்கப்பட்ட செயல்பாட்டு செலவுகள் மற்றும் சிறந்த வள பயன்பாடு.

சில முக்கிய ஆட்டோமேஷன் உத்திகள்

  • பதிப்பு கட்டுப்பாடு உள்கட்டமைப்பு மாற்றங்களுடன் Infrastructure as Code (IaC) செயல்படுத்தல்.

  • தானியங்கு சோதனை மற்றும் rollback திறன்கள் உள்ளிட்ட Continuous Integration/Continuous Deployment (CI/CD).

  • ஒருங்கிணைக்கப்பட்ட health checks மற்றும் தானியங்கு மீட்புடன் Self-healing கணினிகள்.

SRE குழுக்களுக்கான கண்காணிப்பு மற்றும் எச்சரிக்கை உத்திகள்

பயனுள்ள கண்காணிப்பு மற்றும் எச்சரிக்கை, விநியோகிக்கப்பட்ட, மைக்ரோசர்வீஸ் அடிப்படையிலான பயன்பாடுகளின் நம்பகத்தன்மை மற்றும் செயல்திறனை முன்கூட்டியே உறுதி செய்வதற்கு Site Reliability Engineering (SRE) குழுக்களுக்கு முக்கியமானது. நூற்றுக்கணக்கான மைக்ரோசர்வீஸ்கள் கொண்ட விநியோகிக்கப்பட்ட கணினியை கண்காணிப்பது ஒரு சவாலாக இருக்கலாம். கட்டமைப்பின் சிக்கலான தன்மையைப் பொருட்படுத்தாமல், முக்கிய மெட்ரிக்குகளை அடையாளம் கண்டு பயன்பாட்டு செயல்திறன் மற்றும் பயனர் அனுபவத்தில் அவை ஏற்படுத்தும் தாக்கத்திலிருந்து பின்னோக்கி வேலை செய்ய வேண்டும்.

விரிவான Telemetry சேகரிப்பு

  • சேகரிக்கப்படும் telemetry தரவு ஒவ்வொரு கட்டமைப்பு கூறின் ஆரோக்கியம் மற்றும் செயல்திறனில் போதுமான நுண்ணறிவுகளை வழங்குவதை உறுதிப்படுத்தவும். சேகரிக்கப்பட்ட தரவின் பொருத்தம் மற்றும் செயல்படக்கூடிய தன்மையை தொடர்ந்து மதிப்பீடு செய்யுங்கள்.

எச்சரிக்கை உத்தி

  • செயல்படக்கூடிய எச்சரிக்கைகளை வரையறுக்கவும் - Telemetry தரவிலிருந்து உருவாக்கப்படும் எச்சரிக்கைகள் செயல்படக்கூடியதாக இருக்க வேண்டும், SRE குழுக்கள் சிக்கல்களை விரைவாக அடையாளம் கண்டு பதிலளிக்க அனுமதிக்கிறது. எச்சரிக்கைகள் அர்த்தமுள்ள மற்றும் சாத்தியமான சிக்கல்களை முன்கூட்டியே அறிவிக்கும் thresholds மற்றும் patterns-ஐ அடிப்படையாகக் கொண்டிருக்க வேண்டும்.

  • எச்சரிக்கை ரூட்டிங் மற்றும் escalation-ஐ மேம்படுத்தவும் - முக்கியமான சிக்கல்களைப் பற்றி சரியான குழுக்கள் மற்றும் நபர்களுக்கு அறிவிக்கப்படுவதை உறுதி செய்ய நன்கு வரையறுக்கப்பட்ட எச்சரிக்கை ரூட்டிங் மற்றும் escalation செயல்முறையை செயல்படுத்தவும். பதிலளிப்பை மேம்படுத்தவும் எச்சரிக்கை சோர்வை குறைக்கவும் எச்சரிக்கை ரூட்டிங்கை தொடர்ந்து மதிப்பாய்வு செய்து செம்மைப்படுத்துங்கள்.

டாஷ்போர்டிங் மற்றும் காட்சிப்படுத்தல்

  • விரிவான டாஷ்போர்டுகளை உருவாக்கவும் - முக்கிய செயல்பாட்டு மெட்ரிக்குகள், செலவு மற்றும் திறன் திட்டமிடல் தரவு மற்றும் உள்கட்டமைப்பு ஆரோக்கியம் உள்ளிட்ட பயன்பாட்டின் நிலையின் முழுமையான காட்சியை வழங்கும் டாஷ்போர்டுகளை உருவாக்குங்கள். டாஷ்போர்டுகளில் சிக்கல்களை திறம்பட முன்கூட்டியே கணிக்கவும் தடுக்கவும் கூடிய thresholds மற்றும் indicators உள்ளடங்கியிருப்பதை உறுதிப்படுத்தவும்.

  • தரவு சார்ந்த முடிவெடுத்தலை இயக்கவும் - திறன் திட்டமிடல், செயல்திறன் மேம்படுத்தல் மற்றும் சம்பவ பதில் உத்திகள் போன்ற தரவு சார்ந்த முடிவெடுக்கும் செயல்முறைகளுக்கு டாஷ்போர்டுகளிலிருந்து பெறப்படும் நுண்ணறிவுகளைப் பயன்படுத்துங்கள்.

Chaos Engineering மற்றும் பரிசோதனை வழிகாட்டுதல்கள்

Chaos engineering-இன் இலக்கு பயன்பாட்டு நம்பகத்தன்மையை சோதிப்பதும், செயலிழப்புகள், போக்குவரத்தில் திடீர் உயர்வு மற்றும் பிற வெளிப்புற நிகழ்வுகள் போன்ற இடையூறு நிகழ்வுகளுக்கு ஒரு பயன்பாடு எவ்வாறு பதிலளிக்கிறது என்பதைப் புரிந்துகொள்வதும் ஆகும். Chaos engineering குழுகளுக்கு செயல்திறன் தடைகளை மதிப்பீடு செய்யவும், பயன்பாட்டு நடத்தையைப் புரிந்துகொள்ளவும் நிகழ்நேர சூழ்நிலையில் தோல்விகளை சரிசெய்வதற்கான உத்திகளை செயல்படுத்தவும் உதவுகிறது.

Chaos engineering-இல் சிறந்த நடைமுறைகள்

  • சிறியதாக தொடங்கி படிப்படியாக சிக்கலான தன்மையை அதிகரிக்கவும் - இது ஒரு hypothesis-ஐ உருவாக்குவதை உள்ளடக்கும் (உதா., பயன்பாட்டில் போக்குவரத்து 30% அதிகரித்தால், அது எவ்வாறு செயல்படும்),

  • நிலையான நிலையை வரையறுக்கவும்.

  • பரிசோதனைகள் மூலம் தோல்விகளை அறிமுகப்படுத்தவும்.

  • கணினி நடத்தையை கவனித்து திருத்த நம்பகத்தன்மை நடவடிக்கை எடுக்கவும்.

  • வலுவான கண்காணிப்பை செயல்படுத்தவும் - பயனுள்ள chaos engineering-க்கு, logs, metrics, traces போன்ற தொடர்புடைய telemetry தரவை சேகரிப்பதை உறுதிப்படுத்தவும்.

  • எப்போதும் rollback திட்டம் வைத்திருக்கவும் - CI/CD pipeline-இல் Chaos Engineering-ஐ ஒருங்கிணைப்பது உங்கள் rollback திட்டங்களை தானியங்குபடுத்தி சோதிக்க முடிவதை உறுதிப்படுத்துகிறது.

  • ஒவ்வொரு பரிசோதனையிலிருந்தும் கற்றுக்கொள்ளுங்கள், கண்டுபிடிப்புகளை ஆவணப்படுத்துங்கள், கணினி நம்பகத்தன்மையை மேம்படுத்துங்கள் மற்றும் chaos engineering-ஐ உங்கள் மேம்பாட்டு வாழ்க்கைச் சுழற்சியில் ஒருங்கிணைக்கவும்.

இந்த Chaos Engineering நடைமுறைகளை முறையாக செயல்படுத்துவதன் மூலம், அமைப்புகள் தங்கள் கணினியின் நம்பகத்தன்மையை கணிசமாக மேம்படுத்தலாம், எதிர்பாராத downtime-ஐ குறைக்கலாம் மற்றும் அதிக நம்பகமான சேவைகளை உருவாக்கலாம். இலக்கு குழப்பத்தை உருவாக்குவது அல்ல, குழப்பமான நிலைமைகளைத் தாங்கக்கூடிய கணினிகளை உருவாக்குவது என்பதை நினைவில் கொள்ளுங்கள்.

குறிப்புகள்