Interview preparation / साक्षात्कार अभ्यास
LLMOps
60 questions / प्रश्न · 6 sections
Fundamentals Q1–10
- What is LLMOps?LLMOps क्या है?
- What is the difference between MLOps and LLMOps?MLOps और LLMOps में क्या अंतर है?
- What is LLM application ko production mein deploy karne ke major steps?LLM application को production में deploy करने के major steps क्या हैं?
- What is the difference between Development, staging and production environment?Development, staging और production environment में क्या अंतर है?
- Explain LLM application production components kaun.LLM application के production components कौन से होते हैं?
- What is Model serving?Model serving क्या है?
- What is Inference server?Inference server क्या होता है?
- What is LLM API service?LLM API service क्या है?
- How do Synchronous and asynchronous inference differ?Synchronous vs asynchronous inference?
- Describe Production LLM architecture.Production LLM architecture समझाएँ.
Model Serving & Inference Q11–20
- What is LLM inference?LLM inference क्या है?
- How do Self-hosted model and API-based model differ?Self-hosted model vs API-based model?
- How do you deploy Local LLM ko production mein?Local LLM को production में कैसे deploy करेंगे?
- Explain GPU inference kab.GPU inference की ज़रूरत कब होती है?
- How do CPU and GPU inference differ?CPU vs GPU inference?
- How do you optimize Model loading?Model loading कैसे optimize करेंगे?
- Why is Quantization production mein important?Quantization production में क्यों useful है?
- What is Batching?Batching क्या है?
- What is Continuous batching?Continuous batching क्या है?
- What is Streaming inference?Streaming inference क्या है?
Performance & Scaling Q21–30
- How do you reduce LLM latency ko?LLM latency को कैसे reduce करेंगे?
- What is TTFT?TTFT क्या है?
- What is Tokens/sec?Tokens/sec क्या है?
- What is Throughput?Throughput क्या है?
- How do you handle Concurrent requests?Concurrent requests कैसे handle करेंगे?
- How do Horizontal and vertical scaling differ?Horizontal vs vertical scaling?
- What is Load balancing?Load balancing क्या है?
- Why is Request queue important?Request queue क्यों उपयोग करते हैं?
- How would you approach Caching LLM applications?Caching LLM applications में कैसे उपयोग होती है?
- How would you approach High-traffic LLM API scale?High-traffic LLM API को scale कैसे करेंगे?
Cost & Reliability Q31–40
- Explain LLM application cost kin factors par depend karti.LLM application की cost kin factors पर depend करती है?
- How do you optimize Token cost?Token cost कैसे optimize करेंगे?
- How do Small and large model routing differ?Small vs large model routing?
- What is Model fallback?Model fallback क्या है?
- What is Retry strategy?Retry strategy क्या है?
- What is Exponential backoff?Exponential backoff क्या है?
- What is Rate limiting?Rate limiting क्या है?
- What is Circuit breaker?Circuit breaker क्या है?
- How would you approach Timeout handling?Timeout handling कैसे करेंगे?
- Describe Production LLM failure recovery architecture.Production LLM failure recovery architecture समझाएँ.
Evaluation & Monitoring Q41–50
- How would you approach Production LLM application monitor?Production LLM application को monitor कैसे करेंगे?
- What is Quality monitoring?Quality monitoring क्या है?
- Latency monitoring?Latency monitoring?
- Token/cost monitoring?Token/cost monitoring?
- Error-rate monitoring?Error-rate monitoring?
- What is Continuous evaluation?Continuous evaluation क्या है?
- What is Regression testing?Regression testing क्या है?
- How do you use User feedback ko production improvement mein?User feedback को production improvement में कैसे उपयोग करेंगे?
- Explain LangSmith LLMOps role.LangSmith का LLMOps में क्या role है?
- Explain Production AI system kaun- metrics track.Production AI system के लिए कौन से metrics track करेंगे?
Security & System Design Q51–60
- How would you approach Production LLM application secure?Production LLM application को secure कैसे करेंगे?
- How do API authentication and authorization differ?API authentication vs authorization?
- How do you handle Prompt injection ko production mein?Prompt injection को production में कैसे handle करेंगे?
- How would you approach PII protection?PII protection कैसे करेंगे?
- How do you manage Secrets/API keys ko securely?Secrets/API keys को securely कैसे manage करेंगे?
- How do you design Multi-user LLM application ka architecture?Multi-user LLM application का architecture कैसे डिज़ाइन करेंगे?
- How do you design Multi-tenant AI application kya hai aur?Multi-tenant AI application क्या है और कैसे डिज़ाइन करेंगे?
- Describe RAG + LLM + API ka production architecture.RAG + LLM + API का production architecture डिज़ाइन करें.
- Describe Agent + RAG + Tools + LLMOps ka architecture.Agent + RAG + Tools + LLMOps का architecture डिज़ाइन करें.
- Ek complete production-grade GenAI system design—from user request to monitoring.एक complete production-grade GenAI system डिज़ाइन करें—from user request तो monitoring.