ИИ-агенты 03.07.2026 24 просмотров

Observability и evals для ИИ-агентов в продакшене

#observability #langfuse #evals #production
Observability и evals для ИИ-агентов в продакшене
Как мониторить AI-агентов в prod: Langfuse, Braintrust, online evals, SLA. Метрики для разработки ии агентов и работы с ии агентами.

ИИ-агент в demo отвечает красиво. В prod на 10 000 диалогов — tool loops, silent failures, drift промптов. «Разработка ии агентов» (781) без observability — технический долг. «Работа с ии агентами» (553) в команде требует dashboards, не только логов n8n.

Тренд 2026: LLM ops = agent ops — traces, evals, guardrails как first-class.

Три слоя observability

┌─────────────────────────────────────┐
│  1. Tracing — что произошло         │  Langfuse, OpenAI Traces, Datadog
├─────────────────────────────────────┤
│  2. Evals — насколько правильно     │  Braintrust, LangSmith, custom
├─────────────────────────────────────┤
│  3. Product metrics — бизнес-эффект │  CSAT, escalation rate, cost/dialog
└─────────────────────────────────────┘

Tracing: минимальный schema

Каждый dialog log:

{
  "trace_id": "uuid",
  "session_id": "user-8821",
  "agent_version": "support-v3.2",
  "model": "gpt-4o-mini",
  "steps": [
    {"type": "llm", "tokens_in": 1200, "tokens_out": 89, "latency_ms": 840},
    {"type": "tool", "name": "search_docs", "input": "...", "output_len": 2048},
    {"type": "llm", "tokens_in": 3400, "tokens_out": 120, "latency_ms": 1100}
  ],
  "final_output": "...",
  "escalated": false,
  "cost_usd": 0.0042
}

Langfuse (open-source + cloud):
- SDK для Python, JS, n8n webhook
- Sessions, users, prompt versions
- Cost tracking per model

Интеграция с LangGraph — callback handler из коробки.

OpenAI Agents SDK — built-in traces → экспорт в Langfuse через OTel.

Online vs offline evals

Offline Online
Когда CI/CD, перед релизом Production sample
Данные Golden dataset Live traffic 1–5%
Блокирует deploy Да Алерт, не блок
Пример 200 QA pairs LLM-judge на random 50/день

Offline eval pipeline

  1. Golden set — 100–500 пар (question, expected_tools, reference_answer)
  2. CI job на каждый PR промпта:
  3. run agent
  4. assert tools_called ⊆ expected
  5. faithfulness score > 0.85
  6. Block merge if regression > 5%

Online evals

  • Sample 2% traces → async LLM-judge (cheap model)
  • Metrics: helpfulness, groundedness, policy_violation
  • PagerDuty если policy_violation > 1%

KPI dashboard для ai агентов

KPI Формула Alert
Task success rate resolved без escalate / total < 60%
Tool error rate failed tools / tool calls > 8%
p95 latency percentile(steps latency) > 20s
Cost per dialog sum API $ / dialogs > budget
Hallucination proxy judge groundedness < 0.8
Loop detection iterations > max any spike

Prompt versioning

Храните промпты в Git, не только в n8n UI:

prompts/
  support/
    v3.2.system.md
    v3.2.tools.json

Langfuse Prompt Management — link trace → prompt version → compare A/B.

Связка с Prompt Engineering: versioning обязателен при > 2 авторах промптов.

Red team и regression

Ежемесячно прогоняйте:
- 50 prompt injection cases (безопасность)
- 30 edge cases из prod escalations
- Новые jailbreaks из community

Добавляйте failed cases в golden set — eval flywheel.

n8n-specific observability

  • Execution data retention — настройте cleanup
  • Webhook каждого run → Langfuse / Elasticsearch
  • Tag executions: agent=support, env=prod
  • Error workflow + correlation id в Slack alert

Multi-agent traces

Supervisor + 3 specialists — один trace_id, nested spans:

trace: user-question
  span: supervisor (plan)
  span: research_agent
    span: web_search tool
  span: writer_agent

Без nested tracing невозможно дебажить CrewAI / handoffs.

Cost observability

  • Budget alerts per project (OpenAI usage API)
  • Cache repeated RAG chunks (Redis, TTL 1h)
  • Route simple queries to mini model via classifier agent

Типичный prod: 70% traffic на mini, 30% на 4o — экономия 4–6×.

Tooling landscape 2026

Tool Strength
Langfuse Open-source traces, prompts
LangSmith LangChain/LangGraph native
Braintrust Evals + experiments
Arize Phoenix Embeddings drift
OpenAI Evals OpenAI-only

30-day rollout plan

Week Action
1 Langfuse + trace 100% prod traffic
2 Golden set 50 cases, offline CI
3 Online judge 2%, dashboard
4 Prompt versioning + red team

Anti-patterns

  • ❌ Логи только в stdout без structure
  • ❌ Менять промпт в prod без A/B
  • ❌ Метрика только CSAT без tool errors
  • ❌ Ignoring iteration count spikes (injection / loop)

Вывод

Prod ИИ-агенты без observability и evals — lottery. Traces + golden set + online judge — минимальный стандарт 2026 для разработки ии агентов. Интегрируйте с первого дня, не «потом».

Смотрите также:
- n8n AI Agents production
- Agentic RAG
- MCP architecture

Полезные материалы по теме