HamThoLis
General: We here provide satellite-based crop field boundaries produced in the scope of a research project funded by the F.R.S.-FNRS. Please read the corresponding article National-scale field deline… and the following information carefully before requesting access to the data. The data will be made available upon request for non-commercial research. Derivates of the field delineations, including cropland fraction and field size maps are openly available for downlo….
Methods overview: The crop field delineations are produced from a pre-trained FracTAL ResUNet… that was fine-tuned using pseudo-labels for geographi…. The approach is transferable across space with minimum reference data requirements and code is available in a separate repository. Please read these papers for details on the methods.
Definition of crop field: We define field as a unit of land which can be delineated by its physical appearance through markers of land management or land tenure, and which is actively used to produce annual or (semi-)perennial crops at the time of observation. Our definition excludes fallows (i.e., areas previously under agricultural use but not actively used in the year of observation), as well as tree crops and agroforestry systems due to methodological challenges in automated tree crop mapping. However, our definition includes fields dominantly used for annual crops but with individual farmland trees. Our definition furthermore excludes designated rangelands, which are scarce in Mozambique.
Satellite imagery: We used commercial 1.5 m resolution SPOT 6/7 data provided by Airbus© accessed through the DescartesLabs© platform. To achieve national coverage for the target year (2023), we mosaicked observations from various seasons and included neighboring years (2022 and 2021) for regions where no image was available for the target year. The field delineations contained in this dataset thus represent temporal snapshots from different target dates. The image metadata for each tile is included to identify the exact observation date (join geometries with "tile_id" in the Geopackage _MozFields_SPOT67_TileID.gpkg and the corresponding entry in the metadata table).
Post-processing: For inference, we predicted the probability of a pixel being cropland, a field boundary, and the within-field distance to the nearest boundary for each tile. These pixel level predictions were converted into instances using hierarchical watershed segmentation. We used a rule-based merging procedure to harmonize fields located at tile overlaps. This procedure resulted in millions of non-overlapping vector geometries for each UTM zone. At this stage, we did not account for overlaps at the UTM zone boundaries, so these need to be accounted for by the users. The data contains one .zip file for each UTM zone (EPSG:32636 and EPSG:32637)
Datasets: We provide the following datasets for download:
User control for false positives: The data provided here is heavily biased towards false positives. We designed a post-processing scheme to enable users to reduce commission errors (or false positive fields) based on machine learning. We used a Random Forest model trained with ~2,000 labeled geometries to predict the probability of being a field based on the feature geometry, prediction confidence, and landscape attributes. In our analyses, we used a probability threshold of 0.65 to reduce the commission errors in the data. However, the data provided here purposively includes all geometries produced by the FracTAL ResUNet model. Users can filter the feature attributes contained in the data to reduce false positives based on locally relevant thresholds. The relevant attributes are:
Additional resources: Code for producing pseudo-labels as described in Rufin et al. 2024 is available via https://github.com/philippe…. Model weights for inference are available on Zenodo. Code for post-processing is available via https://github.com/philippe…. Detailed descriptions of the data and methods are available in the corresponding article National-scale field deline… and the corresponding resources on GitHub and Zenodo. Please reach out to philippe.rufin@uclouvain.be for further questions.
-------------------------------------------------------------------------------------------------------------------------------------------
Informação geral: Apresentamos os limites dos campos agrícolas obtidos por satélite, produzidos no âmbito de um projecto de investigação financiado pela F.R.S.-FNRS. Por favor, leia atentamente o artigo de National-scale field deline… e as informações abaixo antes de solicitar acesso aos dados. Os dados serão disponibilizados mediante pedido, exclusivamente para fins de investigação não comercial. Os produtos derivados das delimitações dos campos, incluindo mapas da fracção de terras agrícolas e da dimenção dos campos, encontram-se disponíveis para o download.
Visão geral dos métodos: As delimitações dos campos agrícolas foram produzidas a partir de um modelo FracTAL ResUNet pré-treinado, ajustado com pseudo-rótulos para adaptação ao domínio geográfico. A abordagem é transferível no espaço, com requisitos mínimos de dados de referência, e o código está disponível em um repositório separado. Por favor, leia estes artigos para obter detalhes sobre os métodos.
Definição de campo de cultivo: Definimos «campo» como uma unidade de terreno delimitável pela sua aparência física, por meio de indicadores de gestão ou pelo regime de propriedade da terra, e utilizada activamente para a produção de culturas anuais ou (semi-)perenes no momento da observação. Excluem-se as terras em pousio (ou seja, áreas anteriormente utilizadas para fins agrícolas, mas não utilizadas activamente no ano da observação), bem como as culturas arbóreas e os sistemas agroflorestais, devido a limitações metodológicas no mapeamento automatizado dessas formações. Incluem-se, contudo, campos predominantemente ocupados por culturas anuais, ainda que com árvores isoladas. Excluem-se igualmente as pastagens designadas, que são pouco frequentes em Moçambique.
Imagens de satélite: Utilizámos dados comerciais SPOT 6/7 com resolução de 1,5 m fornecidos pela Airbus©, acedidos através da plataforma DescartesLabs©. Para alcançar uma cobertura nacional do ano-alvo (2023), criámos um mosaico de observações de várias estações, incluido anos vizinhos (2022 e 2021) nas regiões onde não existiam imagens disponíveis para o ano-alvo. As delimitações de campos contidas neste conjunto de dados representam, portanto, instantâneos temporais de diferentes datas-alvo. Os metadados da imagem para cada mosaico foram incluídos para identificar a data exacta da observação (junte as geometrias com «tile_id» no Geopackage _MozFields_SPOT67_TileID.gpkg e a entrada correspondente na tabela de metadados).
Pós-processamento: Para a inferência, previmos, para cada mosaico, a probabilidade de um pixel corresponder a uma área de cultivo, a um limite de campo e à distância dentro do campo até ao limite mais próximo. Estas previsões ao nível do pixel foram convertidas em instâncias através da segmentação hierárquica em bacias hidrográficas. Utilizámos um procedimento de fusão baseado em regras para harmonizar os campos situados em zonas de sobreposições dos mosaicos. Este procedimento resultou em milhões de geometrias vectoriais não sobrepostas para cada zona UTM. Nesta fase, não levámos em conta as sobreposições nos limites das zonas UTM, pelo que os utilizadores devem ter isso em atenção. Os dados contêm um ficheiro .zip para cada zona UTM (EPSG:32636 e EPSG:32637)
Conjuntos de dados: Disponibilizamos os seguintes conjuntos de dados para download:
Controlo do utilizador para falsos positivos: Os dados aqui fornecidos apresentam um forte viés para falsos positivos. Concebemos um esquema de pós-processamento para permitir que os utilizadores reduzam os erros de comissão (ou campos agrícolas com falsos positivos) com base na aprendizagem automática. Utilizámos um modelo Random Forest treinado com cerca de 2000 geometrias rotuladas para prever a probabilidade de se tratar de um campo com base na geometria da característica, na confiança da previsão e nos atributos da paisagem. Nas nossas análises, utilizámos um limiar de probabilidade de 0.65 para reduzir os erros de classificação nos dados. No entanto, os dados aqui fornecidos incluem, propositadamente, todas as geometrias geradas pelo modelo FracTAL ResUNet. Os utilizadores podem filtrar os atributos das características presentes nos dados para reduzir os falsos positivos, com base em limiares localmente relevantes. Os atributos relevantes são:
Recursos adicionais: O código para a produção de pseudo-rótulos, tal como descrito em Rufin et al. 2024, está disponível em https://github.com/philippe…. Os pesos do modelo para inferência estão disponíveis no Zenodo. O código para pós-processamento está disponível em https://github.com/philippe…. Descrições detalhadas dos dados e métodos estão disponíveis no artigo correspondente de National-scale field deline… e nos recursos correspondentes no GitHub e no Zenodo. Por favor, contacte philippe.rufin@uclouvain.be para mais informações.