Módulo profissional
Dados
O mesmo dado estruturado que alimenta cada página deste site — casos, perfis de instituição, o grafo de normas e o radar de normas recentes (janela de 30 dias) — tem esquema documentado e uma amostra real abaixo, pra qualquer pessoa avaliar a forma do dado antes de pedir. O acesso em massa (fora das páginas individuais, que continuam abertas e citáveis) é hoje um módulo profissional: entregue mediante pedido, sob termos de uso, sem tabela de preço pública — a proposta considera o caso. É o que permite sustentar a manutenção contínua deste corpus.
Esta é a captura : um retrato do dataset num instante específico, com contagens que só crescem entre publicações — nunca encolhem em silêncio (ver metodologia).
13.297
processos administrativos sancionadores
274
perfis de instituição
731
normas no grafo
1.814
relações entre normas
142
termos de compromisso
Amostra
Um caso real, encurtado pra leitura — os mesmos campos do esquema abaixo, com valor de verdade, prova a forma do dado antes de qualquer pedido. A amostra usa sempre um caso com sujeito pessoa jurídica: a política de dados deste site proíbe pessoa física como exemplo em qualquer superfície nova (ver política de dados).
{
"pe": "141935",
"materia": "cbe-censo",
"materia_origem": "capitulacao",
"capitulacao": [
"medida-provisoria-2224"
],
"sujeito": {
"camada": "nucleo-cambio",
"tipo": "Banco de Câmbio",
"cnpj": "11703662000144",
"database": "2018-07-01",
"nome": "BANCO CONFIDENCE DE CÂMBIO S.A."
},
"partes": [
{
"nome": "BANCO TRAVELEX S.A.",
"cpf_cnpj": "11703662000144",
"pena": "MULTA",
"valor": 25000,
"situacao": "MULTA PAGA",
"recurso": false
}
],
"atos": [
{
"data": "2019-08-20",
"categoria": "Resumo de Decisão"
}
],
"fonte": "Quadro de Penalidades (Olinda/BCB) e Diário Eletrônico do BCB",
"captura": "2026-09-02",
"decisao": {
"fundamento": "caracterizada a irregularidade consistente no fornecimento intempestivo de informações ao Banco Central do Brasil sobre bens e valores que possuía fora do território nacional, na data-base de 31.12.2013."
}
}Encurtada pra leitura — omite os campos de 2ª instância de partes[] (sempre nulos neste caso; documentados no esquema abaixo mesmo assim) e as camadas de decisao que este caso não usa. A página completa deste caso, com todo campo do esquema, está em /caso/141935/.
Esquema
Cada tipo de arquivo abaixo é descrito com os campos reais do dataset publicado — o mesmo contrato que este site lê, campo a campo, pra montar cada página.
casos/<pe>.json — um arquivo por processo
- pe — número do processo administrativo sancionador (PE), o identificador usado em /caso/<pe>/.
- materia — assunto classificado do processo (ex.: pld-ft, cbe-censo, operacional; sem-capitulacao quando não classificado).
- materia_origem — de onde veio o rótulo de materia: capitulacao (a capitulação foi extraída e a matéria vem dela), ementa (sem capitulação; matéria do resumo do processo), norma (sem capitulação; matéria de uma norma mencionada no texto), residual (sem capitulação; havia texto ou ementa disponível, mas nenhum termo do vocabulário de matérias foi reconhecido) ou null (sem matéria classificada) — ver metodologia.
- capitulacao — lista de slugs de normas do grafo (grafo.json) usadas para fundamentar a penalidade.
- sujeito — objeto ou null: camada (núcleo do câmbio, intermediário, outra supervisionada, ou null), tipo, cnpj, database (base cadastral de origem) e nome; null quando a fonte não identifica pessoa jurídica no processo.
- partes — lista das partes apenadas, cada uma com nome (como na fonte), cpf_cnpj (mascarado quando pessoa física), pena, valor, situacao, recurso (booleano) e, quando houve 2ª instância, pena_2_instancia/valor_2_instancia.
- atos — linha do tempo de atos do processo indexados no Diário Eletrônico do BCB, cada um com data e categoria (ex.: Intimação, Decisão); lista vazia quando nenhum ato foi indexado para o PE (fora da janela de cobertura da fonte, ou não publicado sob esse número).
- decisao — o enredo do caso, em três camadas de fonte com procedência distinta; OMITIDO quando nenhuma camada contribui (a maioria dos processos). Campos, todos opcionais entre si (um caso pode ter só um, alguns ou nenhum): capitulacao_texto (texto da capitulação por extenso, já desambiguado — quando a mesma capitulação aparece em variante suja e limpa na fonte, a suja nunca é publicada), fundamento (prosa do Resumo de Decisão do Diário Eletrônico, que funde narrativa e capitulação), ocorrencias (lista de irregularidades da íntegra do processo — a fonte de maior fidelidade, cada uma com descricao, capitulacao e, quando a própria fonte rotula, irregularidade, a letra do rótulo), origem (de qual camada veio cada campo acima — dispositivos/resumo-decisao/integra) e trecho_fonte (ponteiro adicional pro documento/data concretos, quando a camada permite apontar um mais específico que a captura do caso).
- tc_id (Task 2-ter b) — id do termo de compromisso (tcs/<id>.json, abaixo) CASADO a este PE. OMITIDO na imensa maioria dos processos — só os processos com termo de compromisso vinculado nesta captura têm a chave (fail-closed: um termo pendente ou orfao nunca gera este vínculo, mesmo tendo candidatos de PE na leitura).
- crsfn (Task 2-quater) — lista de acórdãos do Conselho de Recursos do Sistema Financeiro Nacional (CRSFN) que citam este PE como "processo na primeira instância". OMITIDA na imensa maioria dos processos — só os 700 processos casados nesta captura têm a chave (um PE pode ter mais de um acórdão: recurso e embargos de declaração, por exemplo — ordenados por data). Cada item: id_documento (identificador do documento no SEI), data (AAAA-MM-DD — data de PUBLICAÇÃO do inteiro teor no SEI; a fonte não expõe data de julgamento em separado), sessao, processo_sei, tipos (ex.: "Recurso voluntário", "Embargos de declaração"), relator e ementa — os últimos cinco OMITIDOS (nunca null) quando o texto do próprio acórdão não os traz de forma extraível —, url_inteiro_teor (link ao documento oficial no SEI) e fonte. Casamento por número de PE citado no texto do acórdão (formatos "BCB"/ "BACEN" — a mesma instituição sob o nome histórico — ou a anotação explícita "(PE …)"); um PE reconhecido que não existe no corpus desta captura nunca gera a chave, e nunca é fabricado.
- fonte / captura — proveniência institucional e data de captura deste registro.
perfis/<raiz>.json — um arquivo por instituição, agregado por RAIZ de CNPJ (8 dígitos)
Um grupo econômico pode responder a um processo pelo estabelecimento que o cadastro casou no cruzamento (matriz ou uma filial) e ser penalizado, na mesma fonte sancionadora, sob o CNPJ de OUTRO estabelecimento do mesmo grupo — agregar por raiz junta as duas pontas numa só ficha.
- raiz — raiz de CNPJ (8 primeiros dígitos), identificador do grupo econômico.
- casos — PEs em que essa instituição aparece (por qualquer estabelecimento da raiz, não só o que foi sujeito resolvido).
- tipos — classificações de tipo de instituição atribuídas na fonte.
- estabelecimentos — CNPJs completos (14 dígitos) já vistos sob essa raiz, cada um com database: a 1ª data em que o cadastro registrou aquele CNPJ exato, ou null quando o estabelecimento nunca teve entrada própria lá (só apareceu como parte na fonte sancionadora).
- rastro_de_nomes — histórico de razões sociais somando TODOS os estabelecimentos da raiz, cada entrada com database (época) e nome (como usado naquela época).
- fonte / captura.
Todo CNPJ completo que já foi a chave de um perfil ANTES da agregação por raiz continua com arquivo próprio em perfis/<cnpj>.json — um apontamento simples ({cnpj, alias_de_raiz, captura}) que preserva a URL antiga (/instituicao/<cnpj>/) sem quebrar link nenhum já publicado. Por isso o manifesto (abaixo) distingue duas contagens: perfis é o nº de raízes (instituições distintas, 274 nesta captura); perfis_arquivos é o total de arquivos em perfis/ — os canônicos mais os apontamentos.
tcs/<id>.json — um arquivo por termo de compromisso (Task 2-ter b)
- id — identificador do termo, o mesmo usado em /tc/<id>/.
- titulo — nome do termo tal como publicado pelo Banco Central (pode nomear uma pessoa jurídica ou, em alguns casos, pessoa física — ver pf abaixo).
- data — data do documento (AAAA-MM-DD).
- url_pdf — URL oficial do PDF no site do Banco Central; este dataset nunca republica o PDF em si.
- valor / situacao_ocr — o valor do termo, quando extraído por OCR, SEMPRE ao lado da situação da extração: extraido (valor confiável), sem-valor (nada localizado no documento) ou suspeito (uma leitura foi feita, mas descartada por inconsistência — valor fica null mesmo assim).
- valor_bruto_suspeito — presente só quando situacao_ocr é suspeito: a leitura bruta descartada, visível pra transparência, nunca tratada como valor de confiança em nenhuma soma ou mediana deste site.
- pf — booleano da política de pessoa física (ver política de dados): true faz a página própria do termo noindex e nunca vira agregação/link de PF. Fail-safe por desenho: título sem nenhum sinal reconhecido de pessoa jurídica cai do lado seguro (true), mesmo quando é, de fato, uma pessoa jurídica.
- casamento — a situação do cruzamento processo↔termo, por número de PE lido no OCR do próprio documento: {situacao: "casado", pe, metodo} (o ÚNICO caso que gera o vínculo tc_id em casos/<pe>.json), {situacao: "pendente", motivo, candidatos[]} ou {situacao: "orfao", motivo} (nenhum PE legível no documento). Nem motivo nem candidatos[] (que traz só papel — "alvo", "proposta") publicam o número de um PE candidato sem confirmação: essa informação é da fila de conferência interna do pipeline, nunca do dataset público — publicá-la associaria, sem confirmação, um processo específico a um termo.
- enredo (Task V7, OPCIONAL — fix round 1 acrescenta efeitos_descumprimento e eh_aditamento) — compromitentes/objeto/obrigações/prazo/efeitos do descumprimento, extraídos por âncora estrutural do OCR local deste termo (tcs-ocr/<id>.txt, nunca publicado — só estes campos saem pro dataset). Contrato soft POR CAMPO, mesmo padrão de casos/<pe>.json::decisao: cada um só existe quando o extrator reconhece a âncora correspondente NESTE documento específico — nenhum formato único preenchido com vazio. A chave enredo inteira é OMITIDA (nunca {}) quando nenhum campo de conteúdo bate. compromitentes: {quantidade?, trecho_fonte} — quantidade é DERIVADA do maior rótulo ordinal reconhecido ("PRIMEIRA COMPROMITENTE", "VIGÉSIMO SÉTIMO COMPROMITENTE" etc.), publicada só quando o conjunto de valores encontrados reconcilia sem lacuna com a sequência 1..maior — ausente quando não reconcilia (nunca um número já sabido errado). Nunca uma lista de nomes individuais — ver a nota de rejeição no pipeline: campos de endereço/RG/CPF tarjados no PDF original viram sopa de letras maiúsculas no OCR, sem fronteira segura pro nome seguinte. objeto: {trecho_fonte}. obrigacoes / prazo / efeitos_descumprimento: {itens[], trecho_fonte} — um item por Cláusula distinta sob o cabeçalho correspondente, mais o trecho do span inteiro. eh_aditamento: booleano — true quando o documento é um ADITAMENTO (emenda a um termo anterior, âncora "ADITAMENTO DE TERMO DE COMPROMISSO"), usado pra explicar corretamente por que campos de obrigação/prazo estão ausentes (o documento não os traz, não é falha do OCR). Nenhum PE candidato não confirmado (fila interna de casamento, tcs-casamento.json) sobrevive no texto publicado de um TC não casado — redigido por NÚMERO (derivado da fonte bruta), não por forma de citação. Nesta captura, 142 termos publicados: 127 com os cinco campos completos, 14 parciais, 1 sem nenhum campo extraível (ver metodologia).
- fonte / captura.
matriz.json — arquivo único
- celulas — objeto camada → matéria → {total, pes[]}: quantos processos caem nessa combinação e a lista dos PEs correspondentes.
- fonte / captura.
grafo.json — arquivo único, o rol normativo e suas relações
- nos[] — um item por norma: slug, tipo, numero, ementa, status (VIGENTE/REVOGADA/null), versoes, expandido, texto_integral, texto_arquivo (nome do arquivo em textos/, quando houver), texto_versao (proveniência do texto), fonte, url_fonte (endpoint técnico da API, fonte de captura verificável), url_pagina (página oficial humana de leitura — a que este site usa em todo link visível), captura, data_norma (data da norma — assinatura/edição, AAAA-MM-DD; distinta de captura — quando a fonte não traz o campo, ou o nó nunca foi expandido, null), confirmado_ausente_na_fonte (a fonte automatizada FOI consultada e respondeu "não encontrada" para este tipo/número nesta captura — distinto de um nó simplesmente ainda não tentado; true/false).
- arestas[] — uma relação por item: tipo (revoga/altera/mencao/fundamento), origem, destino (slugs), trecho (evidência textual), fonte, captura, ocorrencias (quantas vezes esta MESMA relação se repete dentro do texto de fonte — nunca soma entre fontes distintas), corroboracoes (presente só quando mais de uma fonte independente afirma a mesma relação — quantas fontes ADICIONAIS corroboram, além da de fonte; não incluída em ocorrencias) e destino_nao_canonico (presente só quando o destino não pôde ser resolvido a um slug canônico do rol — ex.: citação sem data reconhecível — e ficou como referência "nua").
textos/<slug>.txt — um arquivo por norma com texto capturado
Texto puro (não JSON): o texto integral extraído da fonte oficial — da API consolidada do Banco Central ou do acervo em PDF quando a API não tinha a versão consolidada disponível. Só existe para os nós com texto_arquivo preenchido em grafo.json.
diffs/<slug>.json — um arquivo por norma com comparativo de versões (Task 4, revisão final da branch)
Só existe para as normas com as duas pontas do comparativo disponíveis nesta captura — a versão 1 (original, PDF do acervo) e o texto consolidado atual (API); nunca uma cadeia de versões intermediárias (ver metodologia). Um diff novo nasce em quarentena até aprovação do dono antes de entrar aqui — mesma disciplina fail-closed do resto do dataset.
- slug — o mesmo identificador de grafo.json::nos[], a norma comparada.
- de / para — rótulo humano de cada lado da comparação: sempre "texto original (v1, PDF oficial)" e "consolidado atual (API)".
- blocos — o redline em si: array de blocos {tipo, linhas[]} (tipo igual/removido/adicionado; um bloco igual longo ganha omitidas, a contagem de linhas de contexto colapsadas). AUSENTE quando assimetria_cobertura é true — não há redline pra mostrar nesse caso.
- assimetria_cobertura / nota — presentes só quando as duas fontes cobrem quantidades de texto tão diferentes para este documento que a comparação linha a linha não é aplicável (achado real: circular-3280, ~517.000 caracteres sem correspondência quase nenhuma do outro lado); nota é o texto exibido no lugar do redline.
- fonte / captura.
radar.json — arquivo único, pode não existir nesta captura
- captura / janela_dias — tamanho da janela de novidade (30 dias, na captura atual).
- itens[] — normas publicadas dentro da janela: tipo, numero, data (data da norma, ISO), ementa, slug, url_fonte (endpoint técnico), url_pagina (link determinístico pra página oficial de leitura).
radar-arquivo.json — arquivo único, o histórico acumulado do radar (Task 1-bis)
Mesmos campos de radar.json::itens[], mas SEM janela: acumula toda norma já capturada pelo radar, desde a 1ª captura — nunca perde um item quando ele sai dos 30 dias de radar.json. Alimenta a página /radar/arquivo/ e, do lado do pipeline, é derivado do histórico committado pipeline/grafo/sementes-radar.json — a mesma lista que vira semente incremental do grafo.
- itens[] — mesmos campos de um item de radar.json, mais capturado_em (data em que o radar viu esta norma pela 1ª vez).
crsfn-cobertura.json — arquivo único, pode não existir nesta captura (Task 2-quater, revisão sênior)
Só contagens agregadas do que NÃO foi casado ao corpus — nunca uma lista de PEs ou de acórdãos (a política deste site: cobertura declarada, sem publicar candidatos não confirmados).
- total — total de acórdãos do CRSFN nesta captura da fonte.
- com_pe_reconhecido — desses, quantos citam um número de PE reconhecível na origem (formato BCB/BACEN/"(PE …)").
- casados_decisoes / casados_pes — decisões distintas publicadas (republicações já fundidas) e nº de PEs distintos que as recebem — os mesmos números de crsfn em casos/<pe>.json.
- republicacoes_fundidas — quantas publicações mais recentes do MESMO julgamento foram fundidas na decisão canônica (erro material ou falha técnica de divulgação do boletim, nunca uma segunda decisão).
- nao_localizados_acordaos / nao_localizados_pes — acórdãos (e PEs distintos) com número de PE reconhecível mas AUSENTE do corpus desta captura — não fabricados, só não publicados.
- fora_do_escopo — acórdãos de outro órgão que também tramita no CRSFN (CVM, COAF, SUSEP) ou sem número de PE anexado — fora do escopo deste casamento por desenho.
- captura.
vigencias.json — arquivo único, pode não existir nesta captura (Task 3.3)
Cláusulas de vigência ("entra em vigor...", "produz efeitos a partir de...") reconhecidas por padrão formal no texto integral de cada norma — extração conservadora: texto ambíguo (ex.: duas redações da mesma cláusula) não gera item. Alimenta a página /vigencias/.
- captura — data desta publicação; universo_textos — nº de normas com texto integral disponível nesta captura (maior que o nº de itens abaixo: nem todo texto tem cláusula reconhecível).
- itens[] — um item por cláusula reconhecida: slug/tipo/numero (a norma), dispositivo (os sentinelas geral — a norma inteira — e produção de efeitos — quando a norma entra em vigor numa data mas só produz efeitos a partir de outra, posterior —, ou o texto literal do dispositivo/escopo, ex. "o parágrafo único do art. 12"), data (AAAA-MM-DD ou null quando não resolvida), data_origem (texto quando a data está escrita na própria cláusula, data_norma quando resolvida pela data de assinatura/edição da norma — cláusula "na data de sua publicação" —, ou null quando nenhuma das duas resolve), trecho_fonte (o trecho literal de onde o item veio — para um item de lista escalonada, o SPAN CONTÍGUO real que sustenta aquele item: o cabeçalho da cláusula mais todos os itens da lista até e incluindo o alvo, nunca só cabeçalho+alvo pulando os intermediários), url_pagina e fonte.
manifest.json — arquivo único
- captura — data (AAAA-MM-DD) desta publicação do dataset.
- contagens — casos, perfis (raízes de CNPJ), perfis_arquivos (raízes + apontamentos de estabelecimento), nos, arestas, tcs (termos de compromisso, Task 2-ter b), crsfn (processos com decisão do CRSFN casada, Task 2-quater), vigencias (itens da agenda de vigências, Task 3.3) — as mesmas contagens já públicas nos contadores no topo desta página e na home deste site.
Pedido de acesso
Sem tabela de preço pública — a proposta considera o caso. A entrega vem sempre acompanhada de termos de uso (uso interno do contratante, termos que proíbem a reidentificação e a agregação de pessoa física a partir do dado entregue, atribuição da fonte, sem revenda). Conte quem pede e o que precisa abaixo.
Pedido de acesso — Dados
Conte quem pede e o que precisa — a resposta é uma conversa, com proposta de entrega sob termos de uso. Sem tabela de preço pública: a proposta considera o caso.
Licença e atribuição
O dado de origem é público: publicado pelo Banco Central do Brasil em suas próprias APIs e diários oficiais, sem depender de licença nem de autorização deste site pra ser usado. A parte que este projeto acrescenta — a classificação de matéria e camada, o grafo de relações entre normas, os vínculos entre processo e capitulação — é uma compilação: a citação abaixo aponta pra ela quando você referenciar este trabalho por escrito. Para citar uma norma ou caso específico, use a citação ABNT que aparece na própria página dele.
REMISSIVA. Normas do Banco Central do Brasil e jurisprudência sancionadora em câmbio, mercado e ativos virtuais: consulta pública com esquema de dados documentado. Disponível em: https://remissiva.com.br/dataset/. Acesso em: 2 set. 2026.
Versionamento
A captura no rótulo do manifesto (formato AAAA-MM-DD) identifica a edição deste dataset — cada execução nova do pipeline substitui a publicação anterior por uma com captura mais recente, nunca com contagem menor que a anterior (a regra de publicação está descrita na metodologia). Este site não mantém um arquivo histórico público de capturas anteriores — para citar uma edição específica depois que ela for substituída, a data de captura na citação acima é o que identifica exatamente qual retrato do dataset foi usado.
Fontes desta página: Banco Central do Brasil — API de normativos, Olinda, Diário Eletrônico, CRSFN · captura · método