Cloud-Agnostic AI ऑब्ज़र्वेबिलिटी Platform - आर्किटेक्चर
अवलोकन
यह दस्तावेज़ AWS managed services पर निर्मित एक cloud-agnostic AI ऑब्ज़र्वेबिलिटी platform की आर्किटेक्चर का वर्णन करता है। यह platform कई cloud providers में Large Language Model (LLM) वर्कलोड के लिए एकीकृत monitoring, cost optimization, और operational insights प्रदान करता है।
आर्किटेक्चर डायग्राम

आर्किटेक्चर Components
1. LLM Providers Layer (Multi-Cloud)
यह platform कई providers में LLM invocations की monitoring support करता है:
Model लचीलापन
नीचे सूचीबद्ध models इस demo में उपयोग किए गए हैं। चूंकि platform AI gateway के रूप में LiteLLM का उपयोग करता है, आप LiteLLM द्वारा supported किसी भी LLM से replace कर सकते हैं -- बस gateway/litellm-config.yaml को अपने पसंदीदा models से update करें। ऑब्ज़र्वेबिलिटी pipeline आपके model चयन की परवाह किए बिना समान रूप से काम करती है।
AWS Bedrock
- Models: Claude 3 Haiku, Claude 3 Sonnet
- Integration: AWS SDK (boto3)
- Metrics: Token usage, latency, request counts
- Dimension:
CloudProvider=aws
Google Vertex AI
- Models: Gemini 1.5 Pro, Gemini 1.5 Flash
- Integration: Simulated (production में Google Cloud SDK उपयोग होगा)
- Metrics: Token usage, latency, request counts
- Dimension:
CloudProvider=gcp
Azure OpenAI
- Models: GPT-4o, GPT-4o Mini
- Integration: Simulated (production में Azure SDK उपयोग होगा)
- Metrics: Token usage, latency, request counts
- Dimension:
CloudProvider=azure
On-Premises (Ollama)
- Models: Llama 3.1 70B, Mistral 7B
- Integration: Simulated (production में Ollama API उपयोग होगा)
- Metrics: Token usage, latency, request counts
- Dimension:
CloudProvider=on-prem
2. Application Layer
Python Application
- Framework: Instrumentation के लिए OpenTelemetry SDK
- Language: Python 3.8+
- जिम्मेदारियां:
- Providers में LLM APIs invoke करना
- Telemetry collect करना (metrics, traces, logs)
- OpenTelemetry Collector को data भेजना
OpenTelemetry Collector
- Protocol: OTLP (OpenTelemetry Protocol)
- Format: Cloud-agnostic, vendor-neutral
- जिम्मेदारियां:
- Application से telemetry receive करना
- Data transform और enrich करना
- AWS services को export करना
3. AWS ऑब्ज़र्वेबिलिटी Stack
Amazon CloudWatch
- Service Type: Managed metrics और monitoring
- Region: us-east-1
- Namespace:
AIObservability - Metrics:
InputTokens- Prompts के लिए token countOutputTokens- Completions के लिए token countLatency- Milliseconds में response time
- Dimensions:
Model- LLM model identifierCloudProvider- Provider (aws, gcp, azure, on-prem)
- Retention: 15 महीने (default)
- Cost: प्रति metric प्रति माह $0.30 (पहले 10,000 metrics मुफ़्त)
AWS X-Ray
- Service Type: Distributed tracing
- Region: us-east-1
- जिम्मेदारियां:
- Services में request flow ट्रैक करना
- Performance bottlenecks पहचानना
- Service dependencies visualize करना
- Trace Format: X-Ray segment documents
- Retention: 30 दिन
- Cost: 1 million traces recorded प्रति $5.00
CloudWatch Logs
- Service Type: Log aggregation और analysis
- Region: us-east-1
- Log Group:
/ai-observability-demo - Format: JSON structured logs
- Features:
- Querying के लिए CloudWatch Logs Insights
- Log retention policies
- Alerting के लिए metric filters
- Retention: 7 दिन (configurable)
- Cost: प्रति GB ingested $0.50
Amazon Managed Prometheus (AMP)
- Service Type: Managed Prometheus-compatible monitoring
- Region: us-east-1
- Workspace ID:
<your-amp-workspace-id> - Use Case: Time-series metrics storage
- Query Language: PromQL
- Retention: 150 दिन
- Cost: 1 million samples ingested प्रति $0.10
Amazon Managed Grafana (AMG)
- Service Type: Visualization के लिए managed Grafana
- Region: us-east-1
- Workspace ID:
<your-amg-workspace-id> - Authentication: IAM Identity Center (SSO)
- Data Sources:
- Amazon CloudWatch
- AWS X-Ray
- Amazon Managed Prometheus
- Features:
- Template variables के साथ dynamic dashboards
- Multi-cloud filtering
- Auto-refresh (30 seconds)
- Cost: प्रति active user प्रति माह $9.00
4. Security और Access Control
IAM Role (Grafana Access)
- Role Name:
ai-observability-grafana-role - उद्देश्य: Grafana को AWS services query करने की अनुमति देना
- Managed Policies:
CloudWatchReadOnlyAccessAWSXRayReadOnlyAccessAmazonPrometheusQueryAccess
- Trust Policy: Grafana workspace को role assume करने की अनुमति
- Least Privilege सिद्धांत: केवल read-only access
IAM Identity Center (SSO)
- Region: us-east-2 (Ohio)
- उद्देश्य: Grafana users के लिए single sign-on
- Users:
<your-email>(ADMIN role) - Integration: SAML 2.0 authentication
- लाभ:
- केंद्रीकृत user management
- MFA support
- Audit logging
5. Visualization और Query Layer
Grafana Dashboard
- Type: Template variables के साथ dynamic dashboard
- File:
grafana/dashboards/ai-observability-dynamic.json - Features:
- Cloud Provider dropdown (auto-discovers: aws, gcp, azure, on-prem)
- Model dropdown (सभी models auto-discover)
- Multi-select filters
- Real-time metrics (30s refresh)
- Panels:
- Model-wise Input Tokens (time series)
- Model-wise Output Tokens (time series)
- Model-wise Latency (time series)
- Total Requests (stat)
- Average Latency (stat)
CloudWatch Dashboard
- Name:
AI-Observability-Demo - Type: Native CloudWatch dashboard
- Widgets:
- Input/Output token metrics
- Latency statistics
- Request counts
- Dimensions: Model और CloudProvider
- Access: AWS Console
MCP Server (Natural Language Queries)
- Technology: Model Context Protocol
- Language: Python 3.8+
- Integration: Kiro IDE
- Tools:
get_token_usage- Token consumption queryget_model_latency- Latency statistics queryget_request_count- Request volumes queryget_cost_estimate- Cost estimatecompare_models- Side-by-side comparison
- Query Examples:
- "कौन सा model सबसे अधिक tokens consume कर रहा है?"
- "Claude Haiku की average latency क्या है?"
- "पिछले एक घंटे के LLM costs estimate करें"
Kiro IDE Integration
- उद्देश्य: Developer-centric ऑब्ज़र्वेबिलिटी
- Features:
- IDE में natural language queries
- Dashboards पर context switch करने की आवश्यकता नहीं
- Development के दौरान real-time metrics
- Configuration:
kiro-mcp-config.json
6. Alerting और Notifications
CloudWatch Alarms
- उद्देश्य: Proactive monitoring और alerting
- Alarm Types:
- Cost threshold breaches
- Latency SLA violations
- Error rate increases
- Token usage anomalies
- Actions: SNS notifications trigger करना
Amazon SNS
- उद्देश्य: Multi-channel notifications
- Channels:
- SMS
- Slack (webhook द्वारा)
- PagerDuty integration
- Subscribers: Operations team
Data Flow
1. LLM Invocation Flow
User Request → Application → LLM Provider API
↓
OpenTelemetry SDK
↓
(Collect Telemetry)
↓
OTLP Collector
2. Telemetry Export Flow
OTLP Collector → CloudWatch (Metrics)
→ X-Ray (Traces)
→ CloudWatch Logs (Logs)
→ Prometheus (Time Series)