📊AI Observability

AI Observability: OpenTelemetry ל-LLM

AI ללא observability = קופסה שחורה ב-production. 4 שכבות טלמטריה - traces, metrics, logs, evals. Semantic conventions GenAI, KPI, אות מול רעש.

מאת: אמיל סלאבין · 11 ביוני 2026 · 13 דקות קריאה

TL;DR

AI ללא observability = קופסה שחורה. 4 שכבות, OpenTelemetry, KPI, אות vs רעש.

4
שכבות טלמטריה
13 דק'
קריאה
OTel
תקן
Real-time
KPI tracking

ארבע שכבות

1. Traces (OpenTelemetry GenAI conventions)

כל LLM-call - span עם attributes: gen_ai.system, gen_ai.request.model, gen_ai.usage.input_tokens, gen_ai.usage.output_tokens, gen_ai.response.finish_reason. RAG retrieval - span נפרד. Agentic chain - span אב עם child spans על כל tool call.

2. Metrics

Token usage per tenant (cost control). Latency P50/P95/P99 per endpoint. RAG recall@5 ו-hit rate. Refusal rate. Cost per conversation. Export ל-Prometheus / Datadog.

3. Logs (structured)

Full conversation log עם PII redaction. Source citations לכל תשובה. User feedback. Refusal reason. Retention 7 שנים ל-regulated.

4. Evals (offline + online)

Offline: golden dataset עם ground truth, evaluation אוטומטי על כל deploy. Online: LLM-as-judge על sample 1%. מטריקות: factual accuracy, helpfulness, safety, citation correctness.

Production setup

  • OpenTelemetry .NET SDK + GenAI extension.
  • Custom span processor ל-PII redaction לפני export.
  • Jaeger / Honeycomb ל-trace visualization.
  • Prometheus + Grafana ל-metrics dashboard.
  • ELK ל-structured logs.
  • LangSmith / Phoenix ל-evals.

אות vs רעש

הטעות העיקרית - alert fatigue. מה לאלרט:

  • Latency P99 > SLA - המשתמש מרגיש.
  • Refusal rate spike - מודל / RAG הידרדרו.
  • Cost spike - בוט בלולאה או DoS.
  • Eval score drop - איכות התשובה ירדה.

מה לקחת מכאן

  1. Observability מהיום הראשון. לא "נוסיף אחר כך".
  2. OpenTelemetry GenAI conventions - תקן. אל תמציאו attributes משלכם.
  3. Evals offline + online. רק offline - לא תופסים regression. רק online - אין baseline.
  4. PII redaction לפני export. אחרת הטלמטריה הופכת attack surface.