LLM Observability: What to Track and Why
Back to all articles
AI Engineering
16 min read8 min read

LLM Observability: What to Track and Why

Essential metrics and logging for production LLM applications. Covers latency, costs, quality metrics, and alerting strategies.

Debasish Maji
Debasish Maji
AI Engineering Lead
April 16, 2026
ObservabilityMonitoringProductionMetrics

Why LLM Observability Is Different

Traditional observability focuses on latency, errors, and throughput. LLMs add new dimensions: output quality, token usage, model behavior drift, and semantic correctness.

You cannot debug what you cannot see. This post documents our complete observability stack for LLM applications.

•••

The Three Pillars Plus One

PillarTraditional UseLLM-Specific Use
MetricsRequest rates, latencyToken usage, costs, quality scores
LogsError messagesFull prompts and responses
TracesRequest flowMulti-step reasoning chains
EvaluationsN/AOutput quality assessment
Evaluations are the fourth pillar for LLM systems.

•••

Metrics to Track

Operational Metrics

MetricWhy It MattersAlert Threshold
Request latency (p50, p95, p99)User experiencep99 > 10s
Error rateReliability> 1%
ThroughputCapacity planningSudden changes
Queue depthBackpressure> 100 requests

Cost Metrics

MetricWhy It MattersAlert Threshold
Tokens per requestCost control> 2x average
Cost per requestBudget tracking> $0.10 per request
Daily spendBudget management> daily budget
Cost by featureROI analysisFeature-specific

Quality Metrics

MetricWhy It MattersAlert Threshold
User feedback ratioSatisfactionThumbs down > 15%
Regeneration rateFirst-try quality> 25%
Task completionEffectiveness< 80%
Hallucination rateAccuracy> 5%
•••

Structured Logging

Every LLM call should log structured data.

Request Log Schema

FieldTypePurpose
request_idstringCorrelation
timestampdatetimeTimeline
user_idstringUser context
modelstringWhich model
prompt_tokensintInput size
completion_tokensintOutput size
latency_msintPerformance
statusstringSuccess/failure
error_typestringFailure category

Response Log Schema

FieldTypePurpose
request_idstringCorrelation
prompt_hashstringIdentify prompt version
response_hashstringIdentify duplicates
finish_reasonstringWhy generation stopped
tool_callsarrayFunctions called
quality_scorefloatAutomated assessment

Sensitive Data Handling

Data TypeHandlingWhy
User PIIRedactPrivacy compliance
Full promptsHash or encryptSecurity
ResponsesRetention policyStorage costs
API keysNever logSecurity
•••

Distributed Tracing

LLM applications often involve multiple steps. Trace them all.

Trace Structure

SpanWhat It Captures
RootFull request lifecycle
PreprocessingInput validation, prompt building
LLM CallAPI call to model
Tool ExecutionEach function call
PostprocessingParsing, validation
ResponseFinal formatting

Span Attributes

AttributeValue
model.namegpt-4-turbo
model.provideropenai
tokens.prompt1523
tokens.completion342
cost.usd0.0234
cache.hittrue/false

Multi-Turn Tracing

For conversations, link related traces:

FieldPurpose
conversation_idGroups all turns
turn_numberOrder in conversation
parent_trace_idPrevious turn
context_tokensCumulative context
•••

The Evaluation Pillar

Automated quality assessment at scale.

Evaluation Types

TypeFrequencyMethod
Real-timeEvery requestFast heuristics
Sampled1-5% of requestsLLM-as-judge
BatchDailyFull evaluation suite
ManualWeeklyHuman review sample

Real-Time Evaluations

Fast checks that run on every request:

CheckMethodLatency
Response lengthCharacter count< 1ms
Format validationRegex/schema< 5ms
ToxicityFast classifier< 50ms
Language detectionFast model< 20ms

Sampled Evaluations

Deeper checks on a sample:

EvaluationSample RateMethod
Factual accuracy2%LLM comparison
Relevance5%Embedding similarity
Coherence3%LLM-as-judge
Helpfulness1%Human review
•••

Alerting Strategy

Not every metric needs an alert. Be strategic.

Alert Tiers

TierResponseExamples
CriticalImmediate pageService down, data breach
HighWithin 1 hourError rate spike, quality drop
MediumWithin 1 dayCost anomaly, latency trend
LowWeekly reviewMinor quality drifts

Alert Configuration

MetricConditionTierAction
Error rate> 5% for 5 minCriticalPage on-call
Latency p99> 15s for 10 minHighInvestigate
Daily cost> 150% budgetMediumReview usage
Quality score< 0.8 for 1 hourHighCheck model
Hallucination rate> 10%CriticalPause feature

Anomaly Detection

Beyond static thresholds:

PatternDetection Method
Sudden spikeZ-score > 3
Gradual driftTrend analysis
Periodic anomalySeasonal decomposition
User-specificPer-user baselines
•••

Debugging Workflows

When something goes wrong, how to investigate.

Issue: Quality Degradation

StepWhat to Check
1Recent deployments (prompt changes?)
2Model provider status
3Input distribution shift
4Sample low-quality responses
5Compare to baseline prompts

Issue: Latency Increase

StepWhat to Check
1Model provider latency
2Input token count trend
3Queue depth
4Downstream dependencies
5Trace analysis of slow requests

Issue: Cost Spike

StepWhat to Check
1Request volume change
2Tokens per request trend
3Model mix (expensive models?)
4Retry rate increase
5User/feature breakdown
•••

Dashboard Design

What to put on your LLM observability dashboard.

Overview Dashboard

PanelVisualizationRefresh
Request rateTime series10s
Error rateTime series + threshold10s
Latency percentilesTime series10s
Cost accumulatorCounter1m
Quality scoreGauge5m

Cost Dashboard

PanelVisualization
Daily spendBar chart
Cost by modelPie chart
Cost by featureStacked area
Token efficiencyScatter plot
Budget vs actualProgress bar

Quality Dashboard

PanelVisualization
Quality score trendTime series
Feedback ratioTime series
Hallucination rateTime series
Top failure modesTable
Sample bad responsesLog viewer
•••

Implementation Checklist

CategoryMust HaveNice to Have
MetricsLatency, errors, tokensQuality scores, costs
LogsStructured request logsFull prompt/response
TracesLLM call spansFull conversation traces
EvaluationsReal-time checksSampled LLM-as-judge
AlertsError rate, latencyQuality, cost anomalies
DashboardsOverviewCost, quality, debugging
•••

Key Takeaways

  1. 1Add the evaluation pillar - Traditional observability is not enough. Build automated quality assessment.
  1. 2Log everything structured - Unstructured logs are useless at scale. Define schemas.
  1. 3Trace multi-step reasoning - LLM apps have complex flows. Distributed tracing is essential.
  1. 4Be strategic with alerts - Not every metric needs to page someone. Tier appropriately.
  1. 5Build debugging workflows - When something breaks, have a checklist. Do not improvise.
  1. 6Dashboards for different audiences - Engineers need details. Leaders need summaries. Build both.

You cannot improve what you cannot measure. LLM observability is the foundation for reliable, cost-effective AI systems in production.

Found this helpful?

Share it with others who might benefit

TweetShare

Related articles