Esta página explica, para quem não é especialista, como foi gerada a População Sintética de Portugal (versão 1.0.3), o que se pode e não se pode fazer com ela, e onde estão os seus limites. A versão técnica completa é a ficha do modelo, em inglês.

O que é uma população sintética?

É um conjunto de pessoas e agregados gerados por computador, com um registo por pessoa, cujas contagens somadas seguem as tabelas que o INE publicou nos Censos 2021 para cada freguesia. Nenhum registo é uma pessoa real.

Pessoas e agregados gerados, não pessoas, famílias ou moradas reais.

Para que serve, então? As tabelas publicadas dão, para cada freguesia, quantas pessoas há por idade, por escolaridade ou por tipo de agregado, mas raramente cruzam essas variáveis entre si a uma escala tão pequena. Uma população sintética permite fazer esses cruzamentos, dentro das regras de qualidade que esta página descreve. Pode servir de camada de base para análises demográficas, mas não substitui as estatísticas oficiais.

Tanto quanto nos foi possível apurar, a primeira população sintética de acesso aberto a cobrir todas as freguesias de Portugal, gerada a partir dos Censos 2021.

Como foi gerada?

O resultado não sai diretamente de uma rede neuronal: um modelo inventa pessoas e agregados possíveis, e depois escolhem-se os que, somados, ficam o mais perto possível das tabelas do INE (um processo generativo com restrições). São cinco passos:

  1. Aprender como os atributos se combinam. O computador aprende, com a amostra pública dos Censos 2021 (o Ficheiro de Uso Público), que combinações de idade, escolaridade, trabalho e família são comuns numa pessoa e no seu agregado. Esse modelo (um gerador autorregressivo) é treinado uma vez e depois fica fixo. As idades ano a ano e o tipo de local de trabalho são gerados por ele, não deduzidos depois.
  2. Ajustar cada freguesia às suas tabelas. Para cada freguesia, o modelo inventa muitos agregados possíveis (os candidatos), evitando as combinações que o INE publica como zero nessa freguesia (uma máscara). A máscara restringe os candidatos, mas o resultado pode ainda deixar algumas pessoas nessas combinações: nas tabelas de pessoas do ajuste, cerca de 7 900 entradas (ver «Onde é que os dados são mais fracos?»). Depois, dá mais peso aos candidatos que aproximam as somas das tabelas do INE para a freguesia, mudando o peso de cada um o menos possível (um ajuste de máxima entropia). Antes disso, uma verificação recusaria qualquer freguesia cujas tabelas impliquem totais incoerentes entre si; nenhuma das 3 092 foi recusada.
  3. Escolher agregados inteiros. Uma pessoa não se divide: dos candidatos escolhem-se agregados inteiros, tão perto quanto possível das contagens que as tabelas da freguesia pedem (uma alocação inteira). Nas freguesias com menos de 500 pessoas, essa escolha é resolvida até ao ótimo (uma seleção exata, sem aproximação), o que ainda assim não garante o total do INE. O total gerado nem sempre é o do INE: em 762 freguesias difere, entre 119 pessoas a menos e 30 a mais; no país, são 2 625 pessoas a menos (10 340 441 geradas, contra 10 343 066 residentes segundo o INE). Os níveis de qualidade usam a menor das duas contagens, a contagem de publicação. Freguesia a freguesia, no ficheiro de qualidade.
  4. Acrescentar quem vive em alojamentos coletivos. As pessoas que vivem em lares e noutros alojamentos coletivos são acrescentadas depois do ajuste, a partir das contagens publicadas pelo INE, como registos parciais: o sexo e a idade vêm dessas contagens, a escolaridade é imputada a partir de registos semelhantes, e o núcleo familiar e os campos de trabalho ficam vazios (o dicionário de colunas diz quais). Os códigos finos de profissão são derivados nesta fase.
  5. Publicar com um esquema declarado e o nível de qualidade. Cada coluna publicada tem um significado declarado, e o dicionário de colunas explica cada uma; tudo o resto é retirado, com a razão registada. A versão não inclui ligações entre cônjuges. Cada freguesia sai com um nível de qualidade, A, B ou C (ver «Quando é que um número aparece?»).

O que é ajustado e o que é derivado?

Os números que o site mostra usam nove campos. Seis são agrupamentos de um campo gerado cuja tabela do INE entra no ajuste (a idade em grupos de 5 anos agrupa a idade gerada, ano a ano, e as faixas etárias juntam esses grupos); dois são derivados por uma regra fixa e nenhuma tabela do ajuste os verifica (por exemplo, «vive sozinho» quer dizer que o agregado tem uma só pessoa); e um é um indicador. A tabela diz, para cada um, a coluna dos microdados ou a regra que o calcula a partir delas, com as mesmas letras do dicionário de colunas.

IdadeAgrupamento de um campo ajustado
age_5y (D)Grupo de 5 anos da idade gerada. A tabela do INE por sexo e grupo de 5 anos entra no ajuste.
EscolaridadeAgrupamento de um campo ajustado
education_level_coarse5 (D)Cinco níveis a partir do código de escolaridade gerado (11 níveis). A tabela de escolaridade entra no ajuste.
Condição perante o trabalhoAgrupamento de um campo ajustado
employment_status_coarse3 (D)Empregado, desempregado ou inativo, a partir do código gerado (7 categorias). A condição perante o trabalho entra no ajuste.
Pessoas no agregadoAgrupamento de um campo ajustado
hh_size_bin (D)O número de pessoas do agregado, com 5 ou mais juntos. A tabela de pessoas por agregado entra no ajuste.
Núcleos familiaresAgrupamento de um campo ajustado
hh_type_top (D)O número de núcleos familiares, contado a partir das pessoas do agregado. A tabela de núcleos por agregado entra no ajuste.A resposta do site («Que famílias formam?»): Esta resposta foi calculada antes do empacotamento final dos microdados e pode diferir ligeiramente do que se obtém deles; o produtor vai corrigi-la.
Alojamento coletivoIndicador
is_institutional (flag)1 para um alojamento coletivo acrescentado a partir das contagens do INE, 0 para um agregado privado.
Vive sozinhoDerivado, fora do ajuste
Não é uma coluna:«Sim» quando o agregado da pessoa tem uma só pessoa (hh_size = 1). Nenhuma tabela do ajuste o verifica.
Criança e pessoa de 65+ no agregadoDerivado, fora do ajuste
Não é uma coluna:«Sim» quando o agregado tem pelo menos uma pessoa com menos de 15 anos (age < 15) e outra com 65 ou mais (age ≥ 65). Nenhuma tabela do ajuste o verifica.
Faixa etáriaAgrupamento de um campo ajustado
Não é uma coluna:Menos de 45, 45 a 64, 65 ou mais, a partir da idade (age): cada faixa junta grupos de 5 anos inteiros, e a tabela por grupo de 5 anos entra no ajuste.

As perguntas sobre agregados (pessoas por agregado, núcleos familiares, várias gerações), «quem vive sozinho» e «pessoas com 65 ou mais anos que vivem sozinhas» contam só os agregados privados, o universo de agregados do INE: quem vive num lar ou noutro alojamento coletivo não entra nelas.

Nos microdados descarregáveis, cada coluna traz também a sua origem: gerada pelo modelo (G), derivada de outra coluna (D), tornada coerente depois de gerada (C), ou atribuída a partir do código geográfico (X). O dicionário de colunas explica cada uma, e a página de qualidade diz que tabelas entraram no ajuste e quais foram só avaliadas.

Para ver a ideia com pessoas inventadas, num bairro imaginado, há um exemplo ilustrado. Não usa dados desta população.

Quando é que um número aparece?

Sempre. Todas as 3 092 freguesias são publicadas e respondem a todas as perguntas com os seus próprios números. Cada uma tem um nível de qualidade, que junta quão perto a população gerada fica das tabelas do INE e o número de residentes. O nível é um guia de leitura, não um filtro: não esconde nenhum número, diz com que cuidado o ler. Uma freguesia pequena tem poucas pessoas em cada tabela, e cada pessoa pesa mais.

As freguesias com menos de 500 residentes ficam sempre no nível C. Entre as de nível C com 500 ou mais, a pior tabela é quase sempre a idade ano a ano, que é avaliada mas não é uma das tabelas de pessoas do ajuste, e que as respostas do site não usam: nessas freguesias, a cautela do nível C vale sobretudo para quem usar a idade ano a ano dos microdados. A página de cada freguesia diz o que a pôs no seu nível. Os termos usados para medir o ajuste (erro típico, pior tabela) estão explicados, com um exemplo, no glossário da página de qualidade.

  • Qualidade A776 freguesias

    Freguesia com 2 000 ou mais residentes em que a população gerada reproduz de perto as tabelas publicadas pelo INE.

  • Qualidade B705 freguesias

    Freguesia com 500 ou mais residentes e um ajuste próximo às tabelas do INE. Abaixo de 2 000 residentes, uma freguesia fica em B mesmo com um ajuste igual ao de A.

  • Qualidade C1 611 freguesias

    Freguesia com menos de 500 residentes, ou em que o erro típico ou a pior tabela (nas maiores, quase sempre a idade ano a ano, que as respostas do site não usam) passa os limiares do nível B: lê os números com mais cuidado.

Nesta versão, todas as perguntas são respondidas com os números da própria freguesia, e a página de cada freguesia diz o seu nível de qualidade.

Nenhuma célula é suprimida: todas as categorias de uma pergunta aparecem, mesmo as vazias. «0,0%»: nenhuma pessoa ou agregado gerado nessa categoria, ou tão poucos que a percentagem arredonda para zero.

Esta é a versão 1.0.3, que substituiu três versões datadas de 5 de outubro de 2026 (a 1.0.2 nunca chegou ao GitHub); a população gerada é a mesma em todas. O que mudou entre elas.

O que muda por haver uma só execução?

Esta versão publica uma única execução do modelo: não há amplitude entre execuções e nenhuma comparação direcional entre células é permitida.

Por isso, não há intervalos nos números do site, nem ordenações de freguesias, nem comparações do tipo «mais do que» entre resultados. Uma segunda execução será feita depois da publicação, como medição; a partir de duas execuções, a variação entre elas volta a poder ser mostrada. Mesmo então, só lhe chamaremos intervalo de confiança se a sua cobertura for demonstrada.

Estes dados protegem quem respondeu aos Censos?

Os registos são gerados e não pretendem representar pessoas identificáveis: não têm nomes nem moradas, e as ligações internas aos registos da amostra foram retiradas.

Na auditoria nacional, 10,5% das pessoas e 0,8% dos agregados coincidem com um registo da amostra em 13 atributos. Uma réplica que reutiliza registos da amostra (a referência SA/CO, que a própria auditoria marca como não pronta para uso) chega a 99,1% das pessoas e 99,9% dos agregados. Nos 11 atributos que o modelo gera, 80% das pessoas sintéticas partilham a combinação com alguma pessoa da amostra: são perfis comuns, e a distância ao registo mais próximo continua maior do que entre as pessoas da própria amostra. Não há sinal em excesso de inferência de pertença (adivinhar se alguém estava na amostra usada no treino), nem vantagem na inferência de atributos (adivinhar um atributo de alguém a partir dos outros). A auditoria foi aprovada.

Sintético não quer dizer que coincidências acidentais sejam impossíveis.

Os pormenores estão na página de qualidade.

Para que serve, e para que não serve?

Serve para

  • Exploração demográfica descritiva.
  • Análise de agregados e da população em áreas pequenas, dentro das regras de qualidade publicadas.
  • Jornalismo e aplicações de dados cívicos.
  • Ensino e investigação reprodutível.
  • Cenários agregados e pós-estratificação (reponderar um inquérito para que bata com a população). Esta versão não publica incerteza (uma só execução): trata os números como pontuais.
  • Testar ferramentas que precisam de registos populacionais realistas, mas que não identificam ninguém.

Não serve para

  • Identificar, localizar ou tomar decisões sobre pessoas reais.
  • Tratar uma linha sintética como uma pessoa, uma família ou uma morada.
  • Cruzamentos sem restrições em freguesias muito pequenas ou de qualidade fraca.
  • Conclusões sobre uma freguesia assentes em campos que não são ajustados por freguesia: ramo de atividade, profissão, local de trabalho, meio de transporte, regime de ocupação e divisões da casa (o dicionário de colunas diz quais são).
  • Conclusões causais sobre efeitos de políticas.
  • Prever comportamentos ou simular agentes sem um modelo próprio e validado.
  • Substituir as estatísticas oficiais dos Censos.
  • Decisões jurídicas, de crédito, de seguros, de emprego, policiais ou de elegibilidade.

Onde é que os dados são mais fracos?

São limitações da população gerada, a mesma da versão 1.0.0 à 1.0.3, declaradas em vez de escondidas:

  1. Trabalho e deslocações são os atributos mais fracos. O local de trabalho ou estudo, o meio de transporte, o ramo de atividade (secção da CAE) e a profissão (grande grupo da CPP) ficam muito mais longe das tabelas publicadas do que as tabelas demográficas e de agregado. São avaliados, mas por conceção não entram no ajuste: o modelo gera-os, condicionados à região. Do trabalho, entram no ajuste a condição perante o trabalho, o setor de atividade em quatro grandes grupos e a situação na profissão (ver «Que tabelas foram usadas?»).
  2. Algumas combinações que o INE publica como zero. Cerca de 22 000 pessoas ficam numa combinação que o INE publica como zero para a sua freguesia. A maior parte está na tabela de atividade dos agregados, que fica fora do ajuste como verificação independente. Nas tabelas de pessoas do ajuste são cerca de 7 900 entradas (no máximo 0,08% das pessoas; uma pessoa pode contar em mais de uma tabela), sobretudo em trabalho × escolaridade, escolaridade, condição perante o trabalho e estado civil. A ficha do modelo liga-as a combinações que não aparecem na amostra de treino.
  3. Células pequenas podem faltar. Cerca de 47 000 células pequenas das tabelas publicadas não são reproduzidas; 87% delas têm uma só pessoa.
  4. Algumas famílias invulgares. Bem menos de 1% dos núcleos familiares têm uma forma que os agregados reais da amostra não têm: por exemplo, um núcleo sem ninguém com 15 ou mais anos, ou uma diferença de idade entre mãe e filho acima de 50 anos.
  5. Otimização com limite de tempo. Em 116 freguesias grandes, a última fase de pesquisa parou no limite de tempo e não por ter convergido. Estes resultados dependem da velocidade da máquina; o registo interno do produtor diz como terminou cada uma (não faz parte dos ficheiros publicados).
  6. Residentes em alojamentos coletivos são registos parciais. As pessoas que vivem em lares e noutros alojamentos coletivos são acrescentadas depois do ajuste, a partir das contagens publicadas pelo INE. O sexo e a idade vêm dessas contagens e a escolaridade é imputada a partir de registos semelhantes; a condição perante o trabalho, o estado civil e a nacionalidade estão preenchidos. Ficam vazios, por conceção, o núcleo familiar e os campos de trabalho (situação na profissão, setor, profissão, ramo, local de trabalho e meio de transporte).
  7. Habitação e núcleos familiares. O regime de ocupação (proprietário ou arrendatário) e o número de divisões da casa são publicados nos microdados, mas não são ajustados por freguesia: nas aldeias, a população gerada tem mais arrendatários do que a real. E alguns núcleos familiares gerados têm uma só pessoa, quando no INE um núcleo tem sempre pelo menos duas.

Como se corrige e se atualiza?

  • As versões publicadas no GitHub (1.0.0, 1.0.1 e 1.0.3) continuam disponíveis e citáveis; a 1.0.2 não chegou a ser publicada. As ligações permanentes de cada resposta indicam a versão a que se referem; a página de uma freguesia mostra sempre a versão atual, por isso cita-a com a data da consulta.
  • As correções ficam registadas numa lista pública de erratas.
  • Uma revisão das fontes do INE leva a uma correção documentada ou a uma nova avaliação.
  • A próxima versão (1.1) será uma versão corrigida da população sintética de 2021. Uma versão posterior, com dados de 2025, dirá que campos foram atualizados para 2025, quais foram mantidos de 2021 e quais são novos modelos.
  • Os pesos do modelo não são publicados: isso exigiria uma revisão própria de memorização, privacidade e licença.

Como cito?

A população sintética é publicada por estimador.pt com a licença CC BY-NC 4.0 (Atribuição-NãoComercial 4.0 Internacional): o uso comercial não está abrangido. Os dados do INE em que se baseia são reutilizados com a licença CC BY 4.0 do INE. Ao redistribuir os dados (os ficheiros, ou tabelas tiradas deles), inclui esta atribuição:

Fonte: Instituto Nacional de Estatística, IP – Portugal (Recenseamento Geral da População e Habitação — Censos 2021; período de referência: 2021). Informação modificada: os dados aqui publicados são uma população sintética gerada por estimador.pt a partir das distribuições marginais publicadas e do Ficheiro de Uso Público (FUP) dos Censos 2021, informação do INE reutilizada ao abrigo da licença CC BY 4.0; não constituem microdados oficiais do INE e o INE não é responsável pelo seu conteúdo. A população sintética é publicada por estimador.pt ao abrigo da licença CC BY-NC 4.0 (Atribuição-NãoComercial 4.0 Internacional).

Numa notícia, num gráfico ou num cartão, basta a forma curta, com uma ligação para a página de dados: Fonte: INE, Censos 2021 (CC BY 4.0) · informação modificada por estimador.pt (CC BY-NC 4.0)

Citar como: estimador.pt, População Sintética de Portugal v1.0.3 (2026), CC BY-NC 4.0.

Os ficheiros, o dicionário de colunas, as somas de verificação e o ficheiro de citação estão na página de dados.