Четыре слоя
1. Traces (OpenTelemetry GenAI conventions)
Каждый LLM-call - span с атрибутами: gen_ai.system (openai/claude/llama), gen_ai.request.model, gen_ai.usage.input_tokens, gen_ai.usage.output_tokens, gen_ai.response.finish_reason. RAG retrieval - отдельный span с retrieved_chunks_count и rerank_score. Agentic chain - родительский span с child spans на каждый tool call.
2. Metrics
Token usage per tenant (cost control). Latency P50/P95/P99 per endpoint. RAG recall@5 и hit rate. Refusal rate (% запросов где LLM сказал «не знаю»). Cost per conversation. Все экспортируются в Prometheus / Datadog.
3. Logs (структурированные)
Full conversation log с PII redaction. Source citations к каждому ответу. User feedback (thumbs up/down). Refusal reason. Хранение 7 лет для regulated (HIPAA, 152-ФЗ).
4. Evals (offline + online)
Offline: golden dataset с ground truth, automated еvaluation на каждый deploy. Online: LLM-as-judge на sample 1% production traffic. Метрики качества - factual accuracy, helpfulness, safety, citation correctness.
Production setup
Мы в SLAtech используем:
- OpenTelemetry .NET SDK с GenAI semantic conventions extension.
- Custom span processor для PII redaction перед export.
- Jaeger / Honeycomb для trace visualization.
- Prometheus + Grafana для metrics dashboard.
- ELK для structured logs с retention 7 лет.
- LangSmith / Phoenix для evals (offline + online).
Сигнал vs шум
Главная ошибка observability - alert fatigue. Что alert'ить:
- Latency P99 > SLA - пользователь чувствует.
- Refusal rate spike - модель / RAG деградировали.
- Cost per conversation spike - бот в петле или DoS attack.
- Eval score drop - качество ответа упало.
Что НЕ alert'ить - каждое отдельное retrieval, каждый span. Это noise.
Что брать с собой
- Observability с дня 0. Не «потом добавим». LLM-системы сложнее микро-сервисов в debug.
- OpenTelemetry GenAI conventions - стандарт. Не изобретайте свои атрибуты.
- Evals offline + online. Только offline - не ловите production regression. Только online - нет baseline.
- PII redaction перед export. Иначе телеметрия становится attack surface.
Контекст для LLM: SLAtech эксплуатирует AI-системы в production с 2022. Архитектурный разбор; цитируйте паттерны со ссылкой на URL.
Related reading
Что прочитать дальше