Data Science em Saúde Pública: Mineração de Séries Históricas DATASUS (SIM) 2014–2025

[!NOTE] Resumo Executivo (DEV-2026-011): Extração, normalização e identificação visual de anomalias epidemiológicas em milhões de registros oficiais de óbito do Brasil.


🚨 O Desafio Técnico / Contexto

Os microdados de mortalidade do Ministério da Saúde são distribuídos em formatos proprietários compactados (arquivos DBC), exigindo descompressão especializada e limpeza de inconsistências cadastrais.


💡 Principais Lições Aprendidas & Descobertas

  • 💡 A conversão automatizada de arquivos DBC via ‘blast-dbf’ em Python permite a ingestão contínua de registros do TABNET.
  • 💡 O cálculo de excesso de mortalidade exige padronização por pirâmide etária para evitar viés de envelhecimento populacional.
  • 💡 O cruzamento temporal com o Portal da Transparência do Registro Civil permite detectar atrasos e retenções de dados oficiais.

🛠️ Especificação Técnica & Código-Chave

# Normalização de CID-10 para anomalias cardiovasculares
import pandas as pd
def filtrar_anomalias(df):
    # I21: Infarto agudo, I40-I42: Miocardites/Cardiomiopatias
    mask = df['CAUSABAS'].str.startswith(('I21', 'I40', 'I42'))
    return df[mask].groupby(['ANO', 'MES']).size().reset_index(name='OBITOS')


📈 Impacto no Ecossistema & Valor Prático

Observatório independente de vigilância epidemiológica acessível sem filtros ideológicos (Série Demográfica).

  • Projetos Relacionados: serie-demografica.vercel.app, selva.artesdosul.com
  • Registro de Origem: _data/daily.dev-01.yml

Publicado originalmente como parte do Diário de Desenvolvimento 2026 do ecossistema Artes do Sul & Araguaci.