Como sabemos que funciona?
O que verificámos antes de publicar, quão perto a população gerada fica das tabelas dos Censos, o que fizemos pela privacidade e onde os dados são mais fracos.
Pessoas e agregados gerados, não pessoas, famílias ou moradas reais.
Esta versão passou nos critérios de publicação?
Antes de ler qualquer número
Esta versão publica uma única execução do modelo: não há amplitude entre execuções e nenhuma comparação direcional entre células é permitida.
Na prática: lê cada número por si, sem o ordenar nem o comparar com outro como se a diferença fosse certa.
Notas da ficha de avaliação (texto original)
Escritas para o formato geral da ficha, que prevê várias execuções do modelo. Nesta versão, com uma só execução, não há intervalos; «R=1» quer dizer uma execução, e o estado «ok» quer dizer que a avaliação e a auditoria de privacidade foram aprovadas.
- Os intervalos mostram variação entre execuções do modelo, não intervalos de confiança calibrados.
- O estado só muda para ok quando a avaliação R=1 e a auditoria de privacidade nacional aprovam.
Critérios de publicação
Aprovados
Execuções do modelo
Uma única execução
Auditoria de privacidade
Aprovada
Os critérios que decidem a publicação
Da ficha do modelo, versão 1.0.3
- Cobertura completa: 21 tabelas avaliadas em todas as 3 092 freguesias.
- Zero violações estruturais (registos impossíveis; ver o glossário).
- A proporção de crianças nunca fica mais de 10% abaixo da publicada, em nenhuma região nem classe de tamanho. Nenhuma ficou abaixo: no pior caso fica 0,01% acima (o limite era −10%).
- O total exato de menores de 15 anos em todas as 3 092 freguesias, tanto nos agregados privados como em toda a população residente.
- Uma auditoria de integridade de cada freguesia, com zero erros.
Quão perto ficam das tabelas do INE?
Erro do ajuste face às tabelas do INE (SRMSE): 0 seria igual, e 0,10 quer dizer que cada célula se afasta, grosso modo, 10% do tamanho típico de uma célula. Para cada freguesia, é medido de uma só vez em todas as células das 12 tabelas de pessoas usadas no ajuste, sobre a população residente; o gráfico por tamanho mostra a mediana entre as freguesias de cada classe. É reportado, não é um critério de publicação, e não é o «erro típico da freguesia» que decide os níveis (ver o glossário). Como estas tabelas entraram no ajuste, o erro mede quão perto o ajuste chegou, não quão bem o modelo prevê o que não viu.
Erro do ajuste, por tamanho de freguesia
Mediana entre freguesias, todas as células das 12 tabelas de pessoas; classes pelos residentes do INE; mesma escala do gráfico abaixo
- Menos de 500 residentes882 freguesias0,104
- 500 a 2 000 residentes1 215 freguesias0,056
- 2 000 a 10 000 residentes755 freguesias0,017
- Mais de 10 000 residentes240 freguesias0,008
Ver como tabela: Erro do ajuste face às tabelas do INE, por tamanho de freguesia
| Tamanho | Freguesias | Erro do ajuste |
|---|---|---|
| Menos de 500 residentes | 882 freguesias | 0,104 |
| 500 a 2 000 residentes | 1 215 freguesias | 0,056 |
| 2 000 a 10 000 residentes | 755 freguesias | 0,017 |
| Mais de 10 000 residentes | 240 freguesias | 0,008 |
Erro típico, por tabela
Mediana entre freguesias do erro de cada uma das 12 tabelas de pessoas usadas no ajuste (as de agregados não têm mediana publicada); mesma escala do gráfico acima
- Idade (grupos de 5 anos)0,017
- Estado civil0,063
- Escolaridade0,086
- Condição perante o trabalho0,049
- Principal meio de vida0,077
- Trabalho × escolaridade0,086
- Trabalho × principal meio de vida0,035
- Nacionalidade0,001
- Religião0,002
- Situação na profissão0,047
- Setor de atividade (quatro grandes grupos)0,035
- União de facto0,017
Ver como tabela: Erro típico face às tabelas do INE, por tabela
| Tabela | Erro típico |
|---|---|
| Idade (grupos de 5 anos) | 0,017 |
| Estado civil | 0,063 |
| Escolaridade | 0,086 |
| Condição perante o trabalho | 0,049 |
| Principal meio de vida | 0,077 |
| Trabalho × escolaridade | 0,086 |
| Trabalho × principal meio de vida | 0,035 |
| Nacionalidade | 0,001 |
| Religião | 0,002 |
| Situação na profissão | 0,047 |
| Setor de atividade (quatro grandes grupos) | 0,035 |
| União de facto | 0,017 |
Com poucas pessoas, cada uma pesa mais em cada tabela: por isso cada freguesia tem um nível de qualidade, mostrado no topo da sua página.
Que tabelas foram usadas?
Usadas no ajuste e avaliadas
- Pessoas por agregado e núcleos familiares por agregado
- Acessibilidade do alojamento a pessoas em cadeira de rodas (BGRI)
- As 12 tabelas de pessoas do gráfico acima: idade (grupos de 5 anos), estado civil, escolaridade, condição perante o trabalho, principal meio de vida, trabalho × escolaridade, trabalho × principal meio de vida, nacionalidade, religião, situação na profissão, setor de atividade (quatro grandes grupos) e união de facto
Só avaliadas, fora do ajuste
- Local de trabalho ou estudo
- Meio de transporte
- Ramo de atividade (secção da CAE)
- Profissão (grande grupo da CPP)
- Agregados por número de pessoas empregadas, e por pessoas ativas e dependentes
A ficha de avaliação publica a mediana só das 12 tabelas de pessoas do gráfico. A idade ano a ano também é medida e entra na «pior tabela» que decide o nível (na maior parte das freguesias, é essa a pior), mas não é uma das 21 tabelas da cobertura nem das 12 tabelas de pessoas do ajuste. O ficheiro de qualidade traz, para cada freguesia, a pior tabela e o seu erro (worst_constraint); a página de dados diz que tabela é cada código.
Os erros dos gráficos são medidos nas tabelas usadas no ajuste: dizem quão perto o ajuste chegou. A ficha do modelo refere uma verificação independente, com uma tabela de agregados deixada de fora do ajuste, mas não publica o seu erro (ver «Acerta no que não viu?»).
O que quer dizer qualidade A, B ou C?
Todas as freguesias são publicadas, e todas respondem com os seus próprios números; a página de cada uma mostra o nível no topo. O nível junta o ajuste às tabelas do INE e o número de residentes, e diz com que cuidado ler os números, mas não esconde nada. As contagens são as da versão publicada.
776
freguesias
Freguesia com 2 000 ou mais residentes em que a população gerada reproduz de perto as tabelas publicadas pelo INE.
Lê os números como um retrato próximo das tabelas do INE para a freguesia.
705
freguesias
Freguesia com 500 ou mais residentes e um ajuste próximo às tabelas do INE. Abaixo de 2 000 residentes, uma freguesia fica em B mesmo com um ajuste igual ao de A.
Também próximo das tabelas; numa freguesia com menos de 2 000 residentes, o B pode dizer só o tamanho, não um ajuste pior.
1 611
freguesias
Freguesia com menos de 500 residentes, ou em que o erro típico ou a pior tabela (nas maiores, quase sempre a idade ano a ano, que as respostas do site não usam) passa os limiares do nível B: lê os números com mais cuidado.
O nível C junta dois tipos de freguesia, que se leem de maneira diferente: vê abaixo.
- Menos de 500 na contagem de publicação (883): são C pelo tamanho. Cada pergunta conta só o seu grupo (por exemplo, quem vive sozinho), que pode ser de poucas pessoas: uma ou duas mudam uma percentagem, e 100% pode ser uma ou duas. O topo da página de cada freguesia diz quantos residentes tem.
- 500 ou mais na contagem de publicação (728): são C pela pior tabela (quase sempre a idade ano a ano) ou, em poucas, pelo erro típico. A idade ano a ano fica fora das 12 tabelas de pessoas do ajuste e as respostas do site não a usam: nessas freguesias, a cautela vale sobretudo para quem usar essa coluna dos microdados. O ficheiro de qualidade diz a pior tabela de cada uma, e a página de cada freguesia diz o que a pôs no nível C.
Os limiares de cada nível: A, erro típico até 0,10, a pior tabela até 0,18 e 2 000 ou mais residentes; B, até 0,15 e 0,26 com 500 ou mais residentes; C, as restantes. Uma freguesia com menos de 500 residentes fica no nível C. Os limiares de 500 e 2 000 usam a contagem de publicação, a menor entre os residentes do INE e as pessoas geradas: uma freguesia em que o INE contou 500 pessoas pode ficar abaixo de 500 nessa contagem.
«0,0%»: nenhuma pessoa ou agregado gerado nessa categoria, ou tão poucos que a percentagem arredonda para zero.
Esta é a versão 1.0.3, que substituiu três versões datadas de 5 de outubro de 2026 (a 1.0.2 nunca chegou ao GitHub); a população gerada é a mesma em todas. O que mudou entre elas
O que quer dizer cada termo?
- Erro típico (SRMSE)
- Compara, célula a célula, a contagem gerada com a que o INE publicou: é a raiz do desvio quadrático médio entre as duas, a dividir pela contagem média de uma célula dessa tabela. É um número sem unidades: 0 quer dizer igual; 0,10 quer dizer que, grosso modo, cada célula se afasta cerca de 10% do tamanho típico de uma célula. Quanto mais baixo, mais perto. Numa tabela com uma categoria muito grande (nacionalidade, religião), o erro fica perto de zero mesmo que as categorias pequenas se afastem bastante: não leias um valor baixo como garantia para os grupos pequenos.
- Erro do ajuste (todas as células)
- O erro típico de uma freguesia calculado de uma só vez sobre todas as células das 12 tabelas de pessoas do ajuste, na população residente. O gráfico por tamanho de freguesia mostra a mediana deste erro entre as freguesias de cada classe; é o número da ficha do modelo.
- Erro típico da freguesia
- A mediana dos 12 erros típicos da freguesia, um por tabela de pessoas do ajuste (person_srmse_median no ficheiro de qualidade). É o primeiro critério dos níveis A e B. Não é o número do gráfico por tamanho de freguesia, que junta as células das 12 tabelas num só erro: os dois andam perto, mas não coincidem.
- Pior tabela
- O maior erro típico entre as tabelas de pessoas da freguesia, contando também a idade ano a ano, que é avaliada mas não é uma das 12 tabelas de pessoas do ajuste. É o segundo critério dos níveis; na maior parte das freguesias, a pior tabela é a da idade ano a ano (worst_constraint no ficheiro de qualidade).
- Violação estrutural
- Um registo que a lógica dos dados não permite, verificado registo a registo antes de publicar: por exemplo, uma criança com menos de 15 anos empregada ou com um meio de vida, um curso superior antes dos 18 anos, uma idade negativa ou acima de 115, uma pessoa sem agregado, ou um agregado cujo tamanho não é o número das suas pessoas. Esta versão tem zero. Não conta as pessoas que ficam numa combinação que o INE publica como zero para a sua freguesia: essas combinações são possíveis, só não aparecem nessa freguesia nas tabelas do INE, e estão nas limitações.
- Ajuste de máxima entropia
- A forma de aproximar os candidatos gerados das tabelas do INE, mudando o menos possível o peso de cada um.
- AUC (inferência de pertença)
- Mede, de 0,5 (acaso) a 1 (certeza), se um teste consegue dizer quem estava na amostra. O valor publicado é o excesso sobre o acaso: perto de zero quer dizer que os dados não ajudam.
- Réplica SA/CO
- Um método de referência que monta a população copiando registos da amostra. Serve de termo de comparação para as coincidências: copia quase tudo, por conceção. A própria auditoria marca-o como não pronto para uso (not_ready); é só uma referência.
Estes dados protegem quem respondeu aos Censos?
Os registos são gerados: não têm nomes nem moradas, e não há uma ligação registo a registo a quem respondeu. A auditoria nacional de privacidade, feita sobre a população publicada, foi aprovada. A amostra de que se fala é o Ficheiro de Uso Público dos Censos 2021, de onde o modelo aprendeu as relações entre atributos.
- Coincidências exatas
- 10,5% das pessoas e 0,8% dos agregados coincidem com um registo da amostra em 13 atributos. Para comparação, uma réplica que reutiliza registos da amostra (o teste de referência SA/CO, que a própria auditoria marca como não pronto para uso) chega a 99,1% das pessoas e 99,9% dos agregados.
- Combinações comuns
- Nos 11 atributos que o modelo gera, 80% das pessoas sintéticas partilham a combinação com alguma pessoa da amostra. São perfis comuns, e a distância ao registo mais próximo, nesses 11 atributos, continua maior do que entre as pessoas da própria amostra.
- Distância ao registo mais próximo
- Numa amostra de 5 000 registos, as pessoas sintéticas estão mais longe da amostra do que as pessoas da amostra estão umas das outras: 10,8% das sintéticas coincidem exatamente com o registo mais próximo, contra 74,3% entre registos reais. É uma medida diferente da coincidência exata em 13 atributos (todas as pessoas).
- Inferência de pertença
- Sem sinal em excesso: saber se alguém estava na amostra não fica mais fácil com estes dados (−0,002 AUC para pessoas, −0,007 para agregados).
- Inferência de atributos
- Sem vantagem: adivinhar um atributo de alguém a partir dos restantes não fica mais fácil do que com os próprios dados reais (−0,002).
Sintético não quer dizer que coincidências acidentais sejam impossíveis.
Onde é que os dados são mais fracos?
Limitações conhecidas da população gerada (a mesma da versão 1.0.0 à 1.0.3), declaradas em vez de escondidas. A ficha do modelo remete o plano para as resolver para a próxima versão (a 1.1, uma versão corrigida da população sintética de 2021); cada correção fica registada nas erratas.
Trabalho e deslocações são os atributos mais fracos
O local de trabalho ou estudo, o meio de transporte, o ramo de atividade (secção da CAE) e a profissão (grande grupo da CPP) ficam muito mais longe das tabelas publicadas do que as tabelas demográficas e de agregado. São avaliados, mas por conceção não entram no ajuste: o modelo gera-os, condicionados à região. Do trabalho, entram no ajuste a condição perante o trabalho, o setor de atividade em quatro grandes grupos e a situação na profissão (ver «Que tabelas foram usadas?»).
Algumas combinações que o INE publica como zero
Cerca de 22 000 pessoas ficam numa combinação que o INE publica como zero para a sua freguesia. A maior parte está na tabela de atividade dos agregados, que fica fora do ajuste como verificação independente. Nas tabelas de pessoas do ajuste são cerca de 7 900 entradas (no máximo 0,08% das pessoas; uma pessoa pode contar em mais de uma tabela), sobretudo em trabalho × escolaridade, escolaridade, condição perante o trabalho e estado civil. A ficha do modelo liga-as a combinações que não aparecem na amostra de treino.
Células pequenas podem faltar
Cerca de 47 000 células pequenas das tabelas publicadas não são reproduzidas; 87% delas têm uma só pessoa.
Algumas famílias invulgares
Bem menos de 1% dos núcleos familiares têm uma forma que os agregados reais da amostra não têm: por exemplo, um núcleo sem ninguém com 15 ou mais anos, ou uma diferença de idade entre mãe e filho acima de 50 anos.
Otimização com limite de tempo
Em 116 freguesias grandes, a última fase de pesquisa parou no limite de tempo e não por ter convergido. Estes resultados dependem da velocidade da máquina; o registo interno do produtor diz como terminou cada uma (não faz parte dos ficheiros publicados).
Residentes em alojamentos coletivos são registos parciais
As pessoas que vivem em lares e noutros alojamentos coletivos são acrescentadas depois do ajuste, a partir das contagens publicadas pelo INE. O sexo e a idade vêm dessas contagens e a escolaridade é imputada a partir de registos semelhantes; a condição perante o trabalho, o estado civil e a nacionalidade estão preenchidos. Ficam vazios, por conceção, o núcleo familiar e os campos de trabalho (situação na profissão, setor, profissão, ramo, local de trabalho e meio de transporte).
Habitação e núcleos familiares
O regime de ocupação (proprietário ou arrendatário) e o número de divisões da casa são publicados nos microdados, mas não são ajustados por freguesia: nas aldeias, a população gerada tem mais arrendatários do que a real. E alguns núcleos familiares gerados têm uma só pessoa, quando no INE um núcleo tem sempre pelo menos duas.
Acerta no que não viu?
Ainda não se sabe: comparar a população gerada com números que o modelo não usou (a retrodição) aguarda um apuramento separado, e a ficha de avaliação marca-a como «ainda não disponível». Quando for feita, sai com uma versão nova da população.
Antes de gerar esta população, o produtor registou intervalos de erro para essa verificação fora do ajuste, com o motor anterior. Os erros desta página são medidos nas tabelas do ajuste, por isso não se comparam com esses intervalos, e a página não diz se ficaram «dentro» ou «abaixo» deles.