Saltar para o conteúdo
População sintética
Versão 1.0.3

Como sabemos que funciona?

O que verificámos antes de publicar, quão perto a população gerada fica das tabelas dos Censos, o que fizemos pela privacidade e onde os dados são mais fracos.

Censos 2021 (INE)Versão de 5 de outubro de 2026

Pessoas e agregados gerados, não pessoas, famílias ou moradas reais.

Esta versão passou nos critérios de publicação?

Antes de ler qualquer número

Esta versão publica uma única execução do modelo: não há amplitude entre execuções e nenhuma comparação direcional entre células é permitida.

Na prática: lê cada número por si, sem o ordenar nem o comparar com outro como se a diferença fosse certa.

Notas da ficha de avaliação (texto original)

Escritas para o formato geral da ficha, que prevê várias execuções do modelo. Nesta versão, com uma só execução, não há intervalos; «R=1» quer dizer uma execução, e o estado «ok» quer dizer que a avaliação e a auditoria de privacidade foram aprovadas.

  • Os intervalos mostram variação entre execuções do modelo, não intervalos de confiança calibrados.
  • O estado só muda para ok quando a avaliação R=1 e a auditoria de privacidade nacional aprovam.

Critérios de publicação

Aprovados

Decisões que bloqueiam a publicação se falharem.

Execuções do modelo

Uma única execução

Sem amplitude entre execuções: nada aqui é um intervalo, nem uma ordenação.

Auditoria de privacidade

Aprovada

Auditoria nacional, feita sobre a população da versão 1.0.0, a mesma da versão 1.0.3.

Os critérios que decidem a publicação

Da ficha do modelo, versão 1.0.3

  • Cobertura completa: 21 tabelas avaliadas em todas as 3 092 freguesias.
  • Zero violações estruturais (registos impossíveis; ver o glossário).
  • A proporção de crianças nunca fica mais de 10% abaixo da publicada, em nenhuma região nem classe de tamanho. Nenhuma ficou abaixo: no pior caso fica 0,01% acima (o limite era −10%).
  • O total exato de menores de 15 anos em todas as 3 092 freguesias, tanto nos agregados privados como em toda a população residente.
  • Uma auditoria de integridade de cada freguesia, com zero erros.

Quão perto ficam das tabelas do INE?

Erro do ajuste face às tabelas do INE (SRMSE): 0 seria igual, e 0,10 quer dizer que cada célula se afasta, grosso modo, 10% do tamanho típico de uma célula. Para cada freguesia, é medido de uma só vez em todas as células das 12 tabelas de pessoas usadas no ajuste, sobre a população residente; o gráfico por tamanho mostra a mediana entre as freguesias de cada classe. É reportado, não é um critério de publicação, e não é o «erro típico da freguesia» que decide os níveis (ver o glossário). Como estas tabelas entraram no ajuste, o erro mede quão perto o ajuste chegou, não quão bem o modelo prevê o que não viu.

Erro do ajuste, por tamanho de freguesia

Mediana entre freguesias, todas as células das 12 tabelas de pessoas; classes pelos residentes do INE; mesma escala do gráfico abaixo

  1. Menos de 500 residentes882 freguesias0,104
  2. 500 a 2 000 residentes1 215 freguesias0,056
  3. 2 000 a 10 000 residentes755 freguesias0,017
  4. Mais de 10 000 residentes240 freguesias0,008
Ver como tabela: Erro do ajuste face às tabelas do INE, por tamanho de freguesia
Erro do ajuste face às tabelas do INE, por tamanho de freguesia
TamanhoFreguesiasErro do ajuste
Menos de 500 residentes882 freguesias0,104
500 a 2 000 residentes1 215 freguesias0,056
2 000 a 10 000 residentes755 freguesias0,017
Mais de 10 000 residentes240 freguesias0,008
Avaliação da versão 1.0.3 · Censos 2021 (INE)Versão de 5 de outubro de 2026Metodologia

Erro típico, por tabela

Mediana entre freguesias do erro de cada uma das 12 tabelas de pessoas usadas no ajuste (as de agregados não têm mediana publicada); mesma escala do gráfico acima

  1. Idade (grupos de 5 anos)0,017
  2. Estado civil0,063
  3. Escolaridade0,086
  4. Condição perante o trabalho0,049
  5. Principal meio de vida0,077
  6. Trabalho × escolaridade0,086
  7. Trabalho × principal meio de vida0,035
  8. Nacionalidade0,001
  9. Religião0,002
  10. Situação na profissão0,047
  11. Setor de atividade (quatro grandes grupos)0,035
  12. União de facto0,017
Ver como tabela: Erro típico face às tabelas do INE, por tabela
Erro típico face às tabelas do INE, por tabela
TabelaErro típico
Idade (grupos de 5 anos)0,017
Estado civil0,063
Escolaridade0,086
Condição perante o trabalho0,049
Principal meio de vida0,077
Trabalho × escolaridade0,086
Trabalho × principal meio de vida0,035
Nacionalidade0,001
Religião0,002
Situação na profissão0,047
Setor de atividade (quatro grandes grupos)0,035
União de facto0,017
Avaliação da versão 1.0.3 · Censos 2021 (INE)Versão de 5 de outubro de 2026Metodologia

Com poucas pessoas, cada uma pesa mais em cada tabela: por isso cada freguesia tem um nível de qualidade, mostrado no topo da sua página.

Que tabelas foram usadas?

Usadas no ajuste e avaliadas

  • Pessoas por agregado e núcleos familiares por agregado
  • Acessibilidade do alojamento a pessoas em cadeira de rodas (BGRI)
  • As 12 tabelas de pessoas do gráfico acima: idade (grupos de 5 anos), estado civil, escolaridade, condição perante o trabalho, principal meio de vida, trabalho × escolaridade, trabalho × principal meio de vida, nacionalidade, religião, situação na profissão, setor de atividade (quatro grandes grupos) e união de facto

Só avaliadas, fora do ajuste

  • Local de trabalho ou estudo
  • Meio de transporte
  • Ramo de atividade (secção da CAE)
  • Profissão (grande grupo da CPP)
  • Agregados por número de pessoas empregadas, e por pessoas ativas e dependentes

A ficha de avaliação publica a mediana só das 12 tabelas de pessoas do gráfico. A idade ano a ano também é medida e entra na «pior tabela» que decide o nível (na maior parte das freguesias, é essa a pior), mas não é uma das 21 tabelas da cobertura nem das 12 tabelas de pessoas do ajuste. O ficheiro de qualidade traz, para cada freguesia, a pior tabela e o seu erro (worst_constraint); a página de dados diz que tabela é cada código.

Os erros dos gráficos são medidos nas tabelas usadas no ajuste: dizem quão perto o ajuste chegou. A ficha do modelo refere uma verificação independente, com uma tabela de agregados deixada de fora do ajuste, mas não publica o seu erro (ver «Acerta no que não viu?»).

O que quer dizer qualidade A, B ou C?

Todas as freguesias são publicadas, e todas respondem com os seus próprios números; a página de cada uma mostra o nível no topo. O nível junta o ajuste às tabelas do INE e o número de residentes, e diz com que cuidado ler os números, mas não esconde nada. As contagens são as da versão publicada.

Qualidade A

776

freguesias

Freguesia com 2 000 ou mais residentes em que a população gerada reproduz de perto as tabelas publicadas pelo INE.

Lê os números como um retrato próximo das tabelas do INE para a freguesia.

Qualidade B

705

freguesias

Freguesia com 500 ou mais residentes e um ajuste próximo às tabelas do INE. Abaixo de 2 000 residentes, uma freguesia fica em B mesmo com um ajuste igual ao de A.

Também próximo das tabelas; numa freguesia com menos de 2 000 residentes, o B pode dizer só o tamanho, não um ajuste pior.

Qualidade C

1 611

freguesias

Freguesia com menos de 500 residentes, ou em que o erro típico ou a pior tabela (nas maiores, quase sempre a idade ano a ano, que as respostas do site não usam) passa os limiares do nível B: lê os números com mais cuidado.

O nível C junta dois tipos de freguesia, que se leem de maneira diferente: vê abaixo.

  • Menos de 500 na contagem de publicação (883): são C pelo tamanho. Cada pergunta conta só o seu grupo (por exemplo, quem vive sozinho), que pode ser de poucas pessoas: uma ou duas mudam uma percentagem, e 100% pode ser uma ou duas. O topo da página de cada freguesia diz quantos residentes tem.
  • 500 ou mais na contagem de publicação (728): são C pela pior tabela (quase sempre a idade ano a ano) ou, em poucas, pelo erro típico. A idade ano a ano fica fora das 12 tabelas de pessoas do ajuste e as respostas do site não a usam: nessas freguesias, a cautela vale sobretudo para quem usar essa coluna dos microdados. O ficheiro de qualidade diz a pior tabela de cada uma, e a página de cada freguesia diz o que a pôs no nível C.

Os limiares de cada nível: A, erro típico até 0,10, a pior tabela até 0,18 e 2 000 ou mais residentes; B, até 0,15 e 0,26 com 500 ou mais residentes; C, as restantes. Uma freguesia com menos de 500 residentes fica no nível C. Os limiares de 500 e 2 000 usam a contagem de publicação, a menor entre os residentes do INE e as pessoas geradas: uma freguesia em que o INE contou 500 pessoas pode ficar abaixo de 500 nessa contagem.

«0,0%»: nenhuma pessoa ou agregado gerado nessa categoria, ou tão poucos que a percentagem arredonda para zero.

Esta é a versão 1.0.3, que substituiu três versões datadas de 5 de outubro de 2026 (a 1.0.2 nunca chegou ao GitHub); a população gerada é a mesma em todas. O que mudou entre elas

O que quer dizer cada termo?

Erro típico (SRMSE)
Compara, célula a célula, a contagem gerada com a que o INE publicou: é a raiz do desvio quadrático médio entre as duas, a dividir pela contagem média de uma célula dessa tabela. É um número sem unidades: 0 quer dizer igual; 0,10 quer dizer que, grosso modo, cada célula se afasta cerca de 10% do tamanho típico de uma célula. Quanto mais baixo, mais perto. Numa tabela com uma categoria muito grande (nacionalidade, religião), o erro fica perto de zero mesmo que as categorias pequenas se afastem bastante: não leias um valor baixo como garantia para os grupos pequenos.
Erro do ajuste (todas as células)
O erro típico de uma freguesia calculado de uma só vez sobre todas as células das 12 tabelas de pessoas do ajuste, na população residente. O gráfico por tamanho de freguesia mostra a mediana deste erro entre as freguesias de cada classe; é o número da ficha do modelo.
Erro típico da freguesia
A mediana dos 12 erros típicos da freguesia, um por tabela de pessoas do ajuste (person_srmse_median no ficheiro de qualidade). É o primeiro critério dos níveis A e B. Não é o número do gráfico por tamanho de freguesia, que junta as células das 12 tabelas num só erro: os dois andam perto, mas não coincidem.
Pior tabela
O maior erro típico entre as tabelas de pessoas da freguesia, contando também a idade ano a ano, que é avaliada mas não é uma das 12 tabelas de pessoas do ajuste. É o segundo critério dos níveis; na maior parte das freguesias, a pior tabela é a da idade ano a ano (worst_constraint no ficheiro de qualidade).
Violação estrutural
Um registo que a lógica dos dados não permite, verificado registo a registo antes de publicar: por exemplo, uma criança com menos de 15 anos empregada ou com um meio de vida, um curso superior antes dos 18 anos, uma idade negativa ou acima de 115, uma pessoa sem agregado, ou um agregado cujo tamanho não é o número das suas pessoas. Esta versão tem zero. Não conta as pessoas que ficam numa combinação que o INE publica como zero para a sua freguesia: essas combinações são possíveis, só não aparecem nessa freguesia nas tabelas do INE, e estão nas limitações.
Ajuste de máxima entropia
A forma de aproximar os candidatos gerados das tabelas do INE, mudando o menos possível o peso de cada um.
AUC (inferência de pertença)
Mede, de 0,5 (acaso) a 1 (certeza), se um teste consegue dizer quem estava na amostra. O valor publicado é o excesso sobre o acaso: perto de zero quer dizer que os dados não ajudam.
Réplica SA/CO
Um método de referência que monta a população copiando registos da amostra. Serve de termo de comparação para as coincidências: copia quase tudo, por conceção. A própria auditoria marca-o como não pronto para uso (not_ready); é só uma referência.

Estes dados protegem quem respondeu aos Censos?

Os registos são gerados: não têm nomes nem moradas, e não há uma ligação registo a registo a quem respondeu. A auditoria nacional de privacidade, feita sobre a população publicada, foi aprovada. A amostra de que se fala é o Ficheiro de Uso Público dos Censos 2021, de onde o modelo aprendeu as relações entre atributos.

Coincidências exatas
10,5% das pessoas e 0,8% dos agregados coincidem com um registo da amostra em 13 atributos. Para comparação, uma réplica que reutiliza registos da amostra (o teste de referência SA/CO, que a própria auditoria marca como não pronto para uso) chega a 99,1% das pessoas e 99,9% dos agregados.
Combinações comuns
Nos 11 atributos que o modelo gera, 80% das pessoas sintéticas partilham a combinação com alguma pessoa da amostra. São perfis comuns, e a distância ao registo mais próximo, nesses 11 atributos, continua maior do que entre as pessoas da própria amostra.
Distância ao registo mais próximo
Numa amostra de 5 000 registos, as pessoas sintéticas estão mais longe da amostra do que as pessoas da amostra estão umas das outras: 10,8% das sintéticas coincidem exatamente com o registo mais próximo, contra 74,3% entre registos reais. É uma medida diferente da coincidência exata em 13 atributos (todas as pessoas).
Inferência de pertença
Sem sinal em excesso: saber se alguém estava na amostra não fica mais fácil com estes dados (−0,002 AUC para pessoas, −0,007 para agregados).
Inferência de atributos
Sem vantagem: adivinhar um atributo de alguém a partir dos restantes não fica mais fácil do que com os próprios dados reais (−0,002).

Sintético não quer dizer que coincidências acidentais sejam impossíveis.

Onde é que os dados são mais fracos?

Limitações conhecidas da população gerada (a mesma da versão 1.0.0 à 1.0.3), declaradas em vez de escondidas. A ficha do modelo remete o plano para as resolver para a próxima versão (a 1.1, uma versão corrigida da população sintética de 2021); cada correção fica registada nas erratas.

  1. Trabalho e deslocações são os atributos mais fracos

    O local de trabalho ou estudo, o meio de transporte, o ramo de atividade (secção da CAE) e a profissão (grande grupo da CPP) ficam muito mais longe das tabelas publicadas do que as tabelas demográficas e de agregado. São avaliados, mas por conceção não entram no ajuste: o modelo gera-os, condicionados à região. Do trabalho, entram no ajuste a condição perante o trabalho, o setor de atividade em quatro grandes grupos e a situação na profissão (ver «Que tabelas foram usadas?»).

  2. Algumas combinações que o INE publica como zero

    Cerca de 22 000 pessoas ficam numa combinação que o INE publica como zero para a sua freguesia. A maior parte está na tabela de atividade dos agregados, que fica fora do ajuste como verificação independente. Nas tabelas de pessoas do ajuste são cerca de 7 900 entradas (no máximo 0,08% das pessoas; uma pessoa pode contar em mais de uma tabela), sobretudo em trabalho × escolaridade, escolaridade, condição perante o trabalho e estado civil. A ficha do modelo liga-as a combinações que não aparecem na amostra de treino.

  3. Células pequenas podem faltar

    Cerca de 47 000 células pequenas das tabelas publicadas não são reproduzidas; 87% delas têm uma só pessoa.

  4. Algumas famílias invulgares

    Bem menos de 1% dos núcleos familiares têm uma forma que os agregados reais da amostra não têm: por exemplo, um núcleo sem ninguém com 15 ou mais anos, ou uma diferença de idade entre mãe e filho acima de 50 anos.

  5. Otimização com limite de tempo

    Em 116 freguesias grandes, a última fase de pesquisa parou no limite de tempo e não por ter convergido. Estes resultados dependem da velocidade da máquina; o registo interno do produtor diz como terminou cada uma (não faz parte dos ficheiros publicados).

  6. Residentes em alojamentos coletivos são registos parciais

    As pessoas que vivem em lares e noutros alojamentos coletivos são acrescentadas depois do ajuste, a partir das contagens publicadas pelo INE. O sexo e a idade vêm dessas contagens e a escolaridade é imputada a partir de registos semelhantes; a condição perante o trabalho, o estado civil e a nacionalidade estão preenchidos. Ficam vazios, por conceção, o núcleo familiar e os campos de trabalho (situação na profissão, setor, profissão, ramo, local de trabalho e meio de transporte).

  7. Habitação e núcleos familiares

    O regime de ocupação (proprietário ou arrendatário) e o número de divisões da casa são publicados nos microdados, mas não são ajustados por freguesia: nas aldeias, a população gerada tem mais arrendatários do que a real. E alguns núcleos familiares gerados têm uma só pessoa, quando no INE um núcleo tem sempre pelo menos duas.

Acerta no que não viu?

Ainda não se sabe: comparar a população gerada com números que o modelo não usou (a retrodição) aguarda um apuramento separado, e a ficha de avaliação marca-a como «ainda não disponível». Quando for feita, sai com uma versão nova da população.

Antes de gerar esta população, o produtor registou intervalos de erro para essa verificação fora do ajuste, com o motor anterior. Os erros desta página são medidos nas tabelas do ajuste, por isso não se comparam com esses intervalos, e a página não diz se ficaram «dentro» ou «abaixo» deles.

Como foi feita a populaçãoFicha do modelo (GitHub, em inglês)Descarregar os dados