Empresa
Dados tratados com rigor,
não com otimismo.
A Cavora existe para resolver a parte do trabalho de IA que ninguém quer medir: a qualidade dos dados que entram no modelo.
Página inicialsobre a empresa
Como a Cavora surgiu
A Cavora foi fundada em Belo Horizonte por pessoas que trabalharam em projetos de machine learning e esbarraram sempre no mesmo problema: os datasets chegavam para treinamento sem nenhum documento descrevendo o que estava dentro deles. Balanceamento de classes, duplicatas, campos com informação pessoal não declarada — tudo precisava ser investigado antes de qualquer trabalho de modelagem.
Em vez de tratar isso como tarefa informal, a equipe decidiu estruturar o trabalho. Escopo por escrito, prazo definido, formato de entrega acordado. O nome veio de uma ideia simples: dados brutos chegam como blocos de pedreira — a Cavora mede, classifica e entrega o material em condições de uso.
Hoje a empresa atende equipes de dados em todo o Brasil, com ênfase em projetos que precisam de rastreabilidade — organizações que vão auditar o processo de rotulagem meses depois e precisam encontrar um registro claro do que foi feito, por quem e com qual índice de concordância.
A missão da Cavora é objetiva: entregar dados rotulados com documentação suficiente para que outra equipe, sem acesso à Cavora, consiga reproduzir o processo. Isso significa diretrizes escritas, exemplos trabalhados, métricas de concordância e um script de limpeza que funciona no ambiente do cliente.
Não fazemos afirmações sobre acurácia de modelo, porque isso depende de fatores fora do nosso controle. O que controlamos é a qualidade do insumo — e esse comprometimento está escrito no documento de abertura de cada projeto.
180+
projetos de dados concluídos
5 dias
prazo padrão de revisão de dataset
2× revisão
cada item anotado é revisado duas vezes
BH, BR
com atendimento a equipes remotas
equipe
As pessoas por trás do processo
Cada projeto tem um responsável identificado. Nenhum trabalho passa por etapas sem um nome associado.
Mariana Alves
Coordenadora de Qualidade
Responsável pelos protocolos de revisão e pelos índices de concordância. Trabalhou anteriormente com gestão de dados em pesquisa acadêmica.
Rafael Figueiredo
Líder de Operações de Dados
Coordena sprints de anotação e garante que o schema acordado seja seguido durante todo o ciclo. Experiência em pipelines de dados para NLP e visão computacional.
Camila Souza
Especialista em Diretrizes
Produz os documentos de diretrizes de rotulagem e conduz as rodadas de calibração com as equipes internas dos clientes.
padrões operacionais
Como garantimos a consistência
Cada item da lista abaixo está documentado nos contratos e relatórios entregues. Não são declarações de intenção.
Lote piloto antes do volume
500 itens processados e aprovados pelo cliente antes do início do sprint completo. Erros de schema são corrigidos antes de escalar.
Dupla revisão por item
Cada registro anotado passa por um segundo revisor independente antes de ser incluído no lote final de entrega.
Relatório semanal de concordância
Índices de concordância entre anotadores (Kappa, IoU conforme tarefa) divulgados em formato tabular toda semana.
Confidencialidade por contrato
Acordos de NDA disponíveis antes do envio de qualquer dado. Os dados do cliente são utilizados apenas para o serviço contratado.
Escopo documentado por escrito
Prazo, volume, formato de entrega e critérios de qualidade definidos no documento de abertura. Alterações de escopo precisam de aditivo escrito.
Sinalização de dados pessoais
O relatório de revisão aponta campos que podem conter informação pessoal para que o cliente tome a decisão de tratamento adequado.
valores e conduta
O que orienta o trabalho da Cavora
Preparação de dados para inteligência artificial é um trabalho operacional que exige atenção a detalhes que não aparecem nos artigos sobre modelos: qual é a proporção de cada classe no conjunto? Quantos registros têm o campo-alvo vazio? Existe sobreposição entre os lotes de treino e validação? Essas perguntas determinam se o modelo vai se comportar da forma esperada em produção.
A Cavora trata cada projeto com o mesmo conjunto de verificações, independentemente do tamanho da coleção ou da urgência declarada pelo cliente. Atalhos de processo geram relatórios mais rápidos e datasets com problemas não documentados — preferimos o oposto.
As diretrizes que produzimos são escritas para serem lidas por anotadores novos, não apenas por especialistas. Casos de borda reais, coletados do próprio dataset do cliente, são preferíveis a exemplos hipotéticos. Árvores de decisão substituem parágrafos de texto quando a tarefa tem ramificações claras. O resultado é um documento que diminui a variação entre anotadores na prática, não apenas no papel.
Para equipes de machine learning em Belo Horizonte e em todo o Brasil, a Cavora é uma operação de apoio — não um fornecedor de modelos ou plataformas. O nosso trabalho termina quando o dataset está documentado, limpo, rotulado e entregue no formato do pipeline do cliente.
próximo passo
Tem um projeto de dados em andamento?
Descreva o escopo em poucas linhas. A equipe retorna com uma proposta em até um dia útil.
Falar com a equipe