גָּלֵא עַמִּיקָתָא וּמְסַתְּרָתָא galei amikata umsatrata · revela as coisas profundas e ocultas · Daniel 2:22

Blog/Artigos · Operações

Observabilidade: revelar o profundo e o oculto do sistema em produção

Logs, métricas e traces, OpenTelemetry, a pergunta que você ainda não fez e a diferença para monitoramento, com Datadog e CloudWatch.

Por Juliano Vince de Campos · · 5 min de leitura · 4 seções · 4 figuras

עַמִּיקָתָא GALEI · DANIEL 2:22

Daniel louva Aquele que revela as coisas profundas e ocultas, que sabe o que está na escuridão. Todo sistema em produção tem uma escuridão: o comportamento que você não previu, o caso raro que só aparece na terça à tarde com um cliente específico. Monitoramento ilumina os cantos que você já sabia observar. Observabilidade é a lente que revela o oculto: a capacidade de fazer, depois que o sistema já está rodando, a pergunta que você não tinha pensado em fazer antes.

A pergunta que você ainda não sabia fazer

A diferença entre monitoramento e observabilidade não é de ferramenta, é de capacidade. Monitoramento é sobre perguntas conhecidas: você define dashboards e alertas para as falhas que já antecipa, e ele avisa quando elas acontecem. Funciona bem para o que você previu, e falha exatamente onde dói mais, no problema novo, o unknown unknown que ninguém tinha um gráfico para pegar.

Observabilidade, no sentido que Charity Majors ajudou a popularizar, é a propriedade de um sistema que permite entender qualquer estado interno a partir do que ele emite, incluindo estados que você nunca previu. A pergunta-chave muda de o disco está cheio? para por que este cliente específico, nesta região, com este tipo de conta, está vendo lentidão só neste endpoint? Se você consegue responder isso sem fazer deploy de código novo para investigar, seu sistema é observável.

Figura 1Monitoramento e observabilidade, por tipo de pergunta
Você previu a pergunta?
Monitoramento clássicopergunta conhecida, dashboard pronto: o disco encheu
Alerta cegopreviu mas não instrumentou; sabe que falhou, não por quê
Observabilidadepergunta nova respondida sem novo deploy; revela o oculto
Escuridãopergunta nova sem dado; investigação vira arqueologia
Consegue responder em produção?
Monitoramento cobre o previsto; observabilidade cobre o imprevisto. O canto que importa no incidente novo é o de cima à direita.

Os três pilares: logs, métricas e traces

Observabilidade se sustenta em três tipos de telemetria, cada um com uma força. Métricas são números agregados ao longo do tempo, baratas de armazenar e ótimas para tendência e alerta, mas sem detalhe do caso individual. Logs são registros de eventos discretos, ricos em contexto, mas caros em volume e difíceis de correlacionar se não forem estruturados. Traces seguem uma requisição por todos os serviços que ela atravessa, revelando onde o tempo foi gasto numa arquitetura distribuída.

Nenhum pilar sozinho basta. A métrica diz que a latência subiu, o trace mostra em qual serviço da cadeia ela subiu, e o log daquele serviço explica por quê. O erro comum é investir só em logs, o mais intuitivo, e ficar cego para a jornada distribuída que só o trace revela. Log estruturado, em JSON com campos consultáveis e não texto solto, é o que permite fazer a correlação virar consulta em vez de leitura linha a linha.

Figura 2Os três pilares e o que cada um responde
  • 01Métricasnúmero agregado no tempo; tendência e alerta baratos, sem o caso individual
  • 02Logsevento discreto com contexto rico; poderoso se estruturado, caro em volume
  • 03Tracesa requisição por toda a cadeia; onde o tempo foi gasto no distribuído
Métrica diz que piorou, trace diz onde, log diz por quê. Os três juntos contam a história; um só deixa um pilar cego.

OpenTelemetry e o poder da alta cardinalidade

Por anos, instrumentar telemetria significava se casar com um fornecedor: o agente do Datadog, o formato do CloudWatch, cada um com seu SDK. O OpenTelemetry, projeto da CNCF, quebrou esse casamento ao padronizar a instrumentação: você instrumenta uma vez, no padrão aberto, e exporta para o backend que quiser, trocando de fornecedor sem reescrever o código. É o fim do aprisionamento e a razão pela qual OTel virou o padrão de fato do mercado.

O que separa observabilidade real de dashboard bonito é a alta cardinalidade: a capacidade de fatiar a telemetria por dimensões de altíssima variedade, como ID de usuário, de requisição, de dispositivo. É a cardinalidade que permite responder aquele cliente específico está lento, e não só a média está boa. Ferramentas orientadas a eventos ricos, como o Honeycomb, nasceram dessa ideia; Datadog e CloudWatch também suportam, mas cardinalidade alta custa, e a decisão de quais dimensões manter é engenharia, não configuração automática.

Figura 3Da instrumentação aberta à resposta de alta cardinalidade
  1. 01Instrumenta com OTelpadrão aberto da CNCF, uma vez, sem casar com fornecedor
  2. 02Emite evento ricocom dimensões de alta cardinalidade: usuário, requisição, região
  3. 03Exporta para o backendDatadog, CloudWatch, Honeycomb; troca sem reescrever
  4. 04IAFatia por dimensãoisola o cliente, a região, o endpoint exato
  5. 05Responde o ocultoa pergunta nova é respondida sem novo deploy

Instrumentar no padrão aberto uma vez libera a troca de backend e a pergunta futura que você ainda não fez.

OpenTelemetry desacopla a instrumentação do fornecedor; a alta cardinalidade é o que transforma telemetria em resposta ao caso individual.

Instrumentar é responsabilidade de quem escreve o código

Observabilidade não é algo que a operação instala por cima de um sistema pronto; é uma propriedade que se constrói no código. Quem escreve a função sabe qual estado interno importa emitir, qual dimensão vai importar na investigação futura. Tratar telemetria como preocupação só do time de infraestrutura produz sistemas cegos por dentro, em que a operação tenta adivinhar de fora o que o desenvolvedor poderia ter revelado com uma linha de instrumentação.

A regra prática é instrumentar pensando no incidente futuro: quando isto falhar às três da manhã, que informação a pessoa de plantão vai desejar ter? Emitir essa informação agora, barata, é o que transforma um plantão de duas horas de tateio em dez minutos de diagnóstico. Foi essa disciplina, na CRDC, que ligou a observabilidade aos SLOs: sem telemetria rica do lado do usuário, os nove SLOs não teriam base, e os falsos positivos não teriam como ser separados do que dói de verdade.

Figura 4A pilha da observabilidade, do código à decisão
  1. Instrumentação no código devquem escreve emite o estado que importará no incidente
  2. Coleta padronizada OTelpadrão aberto, sem aprisionamento de fornecedor
  3. Três pilares sinaismétrica, trace e log costurados numa investigação
  4. Alta cardinalidade poderfatiar por dimensão para achar o caso individual
  5. SLI e SLO decisãoa telemetria vira o indicador que define confiabilidade
Observabilidade sobe do código, não desce da infraestrutura. Instrumentar pensando no incidente futuro é o que separa o sistema legível do cego.

Para levar

Observabilidade é a lente que revela o oculto do sistema em produção: não só responder o que você previu, mas fazer a pergunta que ainda não sabia fazer. Métricas, logs e traces costurados, instrumentados no padrão aberto do OpenTelemetry e fatiados por alta cardinalidade, é o que transforma o plantão de tateio em diagnóstico. Datadog, CloudWatch e Honeycomb são o backend; instrumentar bem é do desenvolvedor. A IA correlaciona, aponta a pergunta e cura o custo, mas revelar o profundo continua sendo consequência de código escrito para ser observável.

Tags

  • #julianovincedecampos
  • #Observabilidade
  • #SRE
  • #OpenTelemetry
  • #Datadog
  • #Tracing
  • #Operações

Onde eu estudei, me certifiquei e trabalhei

  • University of Cambridge
  • PUC Minas
  • PUC-RS
  • PUC Goiás
  • Pontificia Universidad Católica del Perú
  • Amazon Web Services
  • Google
  • IBM
  • Oracle
  • COBIT 5 Foundation
  • ITIL v3 Foundation
  • Exemplar Global
  • Red Team Leaders
  • Infosec
  • Salesforce
  • Flowgrammers
  • ISO/IEC 27001
  • NIST Cybersecurity Framework
  • Compass UOL
  • Luby
  • Creditas
  • PicPay
  • PagoNxt, Santander
  • Mercado Pago
  • Itaú Unibanco
  • Foursys
  • Soluti Certificação Digital