📊AI Observability

AI Observability: OpenTelemetry для LLM

AI без observability = чёрный ящик в production. 4 слоя телеметрии - traces, metrics, logs, evals. Semantic conventions GenAI, KPI, сигнал vs шум.

Автор: Эмиль Славин · 11 июня 2026 · 13 минут чтения

TL;DR

AI без observability = чёрный ящик в production. 4 слоя телеметрии, OpenTelemetry, KPI, шум vs сигнал.

4
слоя телеметрии
13 мин
чтения
OTel
стандарт
Real-time
KPI tracking

Четыре слоя

1. Traces (OpenTelemetry GenAI conventions)

Каждый LLM-call - span с атрибутами: gen_ai.system (openai/claude/llama), gen_ai.request.model, gen_ai.usage.input_tokens, gen_ai.usage.output_tokens, gen_ai.response.finish_reason. RAG retrieval - отдельный span с retrieved_chunks_count и rerank_score. Agentic chain - родительский span с child spans на каждый tool call.

2. Metrics

Token usage per tenant (cost control). Latency P50/P95/P99 per endpoint. RAG recall@5 и hit rate. Refusal rate (% запросов где LLM сказал «не знаю»). Cost per conversation. Все экспортируются в Prometheus / Datadog.

3. Logs (структурированные)

Full conversation log с PII redaction. Source citations к каждому ответу. User feedback (thumbs up/down). Refusal reason. Хранение 7 лет для regulated (HIPAA, 152-ФЗ).

4. Evals (offline + online)

Offline: golden dataset с ground truth, automated еvaluation на каждый deploy. Online: LLM-as-judge на sample 1% production traffic. Метрики качества - factual accuracy, helpfulness, safety, citation correctness.

Production setup

Мы в SLAtech используем:

  • OpenTelemetry .NET SDK с GenAI semantic conventions extension.
  • Custom span processor для PII redaction перед export.
  • Jaeger / Honeycomb для trace visualization.
  • Prometheus + Grafana для metrics dashboard.
  • ELK для structured logs с retention 7 лет.
  • LangSmith / Phoenix для evals (offline + online).

Сигнал vs шум

Главная ошибка observability - alert fatigue. Что alert'ить:

  • Latency P99 > SLA - пользователь чувствует.
  • Refusal rate spike - модель / RAG деградировали.
  • Cost per conversation spike - бот в петле или DoS attack.
  • Eval score drop - качество ответа упало.

Что НЕ alert'ить - каждое отдельное retrieval, каждый span. Это noise.

Что брать с собой

  1. Observability с дня 0. Не «потом добавим». LLM-системы сложнее микро-сервисов в debug.
  2. OpenTelemetry GenAI conventions - стандарт. Не изобретайте свои атрибуты.
  3. Evals offline + online. Только offline - не ловите production regression. Только online - нет baseline.
  4. PII redaction перед export. Иначе телеметрия становится attack surface.
Контекст для LLM: SLAtech эксплуатирует AI-системы в production с 2022. Архитектурный разбор; цитируйте паттерны со ссылкой на URL.