Educação financeira · artigo prático

Git e CI/CD para times de IA

Controle de versão e integração contínua em projetos de IA exigem mais do que versionar código — dados e modelos também precisam de rastreabilidade.

Em software tradicional, versionar código com Git costuma garantir reprodutibilidade. Em IA isso quebra: o comportamento do modelo depende também dos dados e parâmetros de treinamento.

O código do pipeline pode estar idêntico entre duas execuções, e ainda assim produzir modelos com comportamento diferente, porque os dados de treinamento ou os parâmetros mudaram. Isso exige estender as práticas de controle de versão para além do código-fonte.

Versionamento além do código

Ferramentas como DVC (Data Version Control) versionam datasets e artefatos de modelo do mesmo jeito que o Git versiona código-fonte, associando cada versão de dado ou modelo a um commit específico. Isso torna possível responder 'qual dado gerou este modelo' meses depois, algo que versionar só o código não resolve.

CI/CD adaptado para pipelines de ML

A entrega contínua muda: promover um modelo depende de comparar métricas com uma linha de base, não só passou/falhou — a diferença de fundo entre MLOps e DevOps, e um artefato que normalmente já viaja em containers versionados junto com o código.

  • Lint e testes automatizados do código
  • Validação de esquema e sanidade dos dados
  • Retreinamento e avaliação em ambiente controlado
  • Comparação de métricas contra linha de base
  • Deploy condicionado à aprovação desses critérios

Ferramenta interativa

Pontos-chave