Este conjunto de dados foi criado para apoiar o desenvolvimento e a avaliação de modelos de deteção de fala sintética para a língua portuguesa. Embora existam muitos conjuntos de dados e estudos focados na língua inglesa, ainda existe uma lacuna significativa de recursos para o português, tanto em termos de disponibilidade de dados como de aplicações práticas.
O principal objetivo deste conjunto de dados é fornecer um corpus diversificado e equilibrado para treino, validação e teste de modelos de aprendizagem automática capazes de distinguir entre fala humana genuína (bonafide) e fala artificialmente gerada ou manipulada (spoof). Estes modelos desempenham um papel cada vez mais importante em áreas como segurança biométrica, verificação de locutor, sistemas anti-spoofing, deteção de desinformação e proteção contra deepfakes de áudio.
O conjunto de dados foi concebido para incluir uma ampla variedade de sotaques, dialetos e variações regionais da língua portuguesa. A fala recolhida cobre o território de Portugal continental, os Açores e a Madeira, bem como outros países e regiões de língua portuguesa, incluindo Brasil, Angola e Moçambique.