Deep learning-based computer vision is increasingly important in agriculture, supporting sustainable practices through tasks like crop type classification and yield prediction. Imagery from Unmanned Aerial Vehicles (UAVs) and ground-based cameras provides key insights into crop phenology, productivity, and management needs across diverse farming systems. However, deep learning models often suffer from limited generalization and spatial transferability due to overfitting to undesired patterns such as spatial autocorrelation or data imbalances. These issues are amplified by label scarcity, data heterogeneity, and the small datasets typical of diversified, small-scale farms. In yield prediction, the use of crop-specific models further fragments the modeling landscape.
This thesis addresses these challenges by evaluating training and validation strategies aimed at improving model generalization. Spatial cross-validation (CV) is tested as a means to reduce spatial overfitting in field-scale yield prediction using UAV-based imagery from the patchCROP landscape laboratory in Brandenburg, Germany. Convolutional Neural Networks (CNNs) trained with spatial CV showed improved transferability between fields compared to those trained with random CV, which substantially overestimated performance due to spatial autocorrelation.
To reduce dependence on labeled data and improve model generalization across crops and management systems, self-supervised learning (SSL) is explored using UAV imagery from multiple fields and crop types. A model pre-trained with the VICReg algorithm was able to extract crop-specific features without labels and, after fine-tuning, outperformed supervised baselines. SSL also enabled the training of a single model for yield prediction across diverse conditions. To test SSL at broader scale, it was applied to the continental Land Use/Cover Area Frame Survey (LUCAS) dataset, covering ten major European crops. SSL models organized crops into semantically meaningful groups without labels and achieved strong performance even with limited labeled data during fine-tuning.
Overall, this thesis demonstrates that spatial CV improves spatial model transferability, while SSL supports generalization across crop types and management conditions and significantly reduces labeling requirements. Beyond improved predictive performance, SSL enables the unification of yield prediction into a single model across diverse crop types and management systems, reducing the need for crop-specific models. Together, these approaches offer practical strategies for developing more general and data-efficient deep learning models for agricultural computer vision. These advances support efforts to scale data-driven tools across spatial and crop-specific boundaries, contributing to more sustainable and input-efficient agriculture. Deep-Learning-basierte Computer Vision gewinnt in der Landwirtschaft zunehmend an Bedeutung, insbesondere bei Anwendungen wie der Klassifikation von Kulturpflanzen und der Ertragsschätzung. Bilddaten von unbemannten Luftfahrzeugen (UAVs) und bodengestützten Kameras liefern wertvolle Informationen über Phänologie, Produktivität und Managementbedarfe in unterschiedlichen Agrarsystemen. Allerdings zeigen Deep-Learning-Modelle häufig eine eingeschränkte Generalisierungsfähigkeit und geringe räumliche Übertragbarkeit, da sie zu einer Überanpassung an unerwünschte Muster wie räumliche Autokorrelationen oder unausgeglichene Datenverteilungen neigen. Diese Probleme werden durch Labelknappheit, Datenheterogenität und die typischerweise kleinen Datensätze in diversifizierten, kleinstrukturierten Landwirtschaftssystemen zusätzlich verstärkt. In der Ertragsschätzung führt zudem der Einsatz kulturartspezifischer Modelle zu einer Fragmentierung des Modellierungsansatzes.
Diese Arbeit adressiert diese Herausforderungen durch die Untersuchung von Trainings- und Validierungsstrategien zur Verbesserung der Modellgeneralisierung. Räumliche Kreuzvalidierung (CV) wird als Methode getestet, um räumliche Überanpassung bei der feldspezifischen Ertragsschätzung zu reduzieren. Verwendet werden UAV-basierte RGB-Bilddaten des patchCROP-Landschaftslabors in Brandenburg. Convolutional Neural Networks (CNNs), die mit räumlicher CV trainiert wurden, zeigten eine deutlich bessere Übertragbarkeit auf andere Felder als Modelle mit zufälliger CV, bei denen die Leistung durch räumliche Autokorrelation überschätzt wurde.
Um die Abhängigkeit von gelabelten Daten zu reduzieren und die Generalisierung über Kulturarten und Bewirtschaftungsformen hinweg zu verbessern, wird selbstüberwachtes Lernen (Self-Supervised Learning, SSL) anhand von UAV-Bilddaten aus mehreren Feldern und Kulturen untersucht. Ein mit dem VICReg-Algorithmus vortrainiertes Modell konnte ohne Labels kulturartspezifische Merkmale extrahieren und übertraf nach Feinabstimmung die überwachten Basismodelle. Zudem ermöglichte SSL das Training eines einheitlichen Modells zur Ertragsschätzung über verschiedene Bedingungen hinweg. Die Skalierbarkeit von SSL wurde mit dem kontinentalen “Land Use/Cover Area Frame Survey” (LUCAS) Datensatz geprüft, der zehn bedeutende europäische Kulturarten umfasst. Die SSL-Modelle gruppierten diese ohne Labels in semantisch sinnvolle Klassen und erzielten auch bei stark reduzierter Labelverfügbarkeit überzeugende Ergebnisse.
Insgesamt zeigt diese Arbeit, dass räumliche CV die Übertragbarkeit von Modellen verbessert, während SSL die Generalisierungsfähigkeit steigert und den Bedarf an gelabelten Daten erheblich reduziert. Über eine gesteigerte Vorhersageleistung hinaus ermöglicht SSL die Vereinheitlichung der Ertragsschätzung in einem einzigen Modell über verschiedene Kulturen und Managementsysteme hinweg. Beide Ansätze bieten praxistaugliche Strategien zur Entwicklung allgemeiner und daten-effizienter Deep-Learning-Modelle für Computer Vision in der Landwirtschaft. Sie leisten einen Beitrag zur Übertragbarkeit datenbasierter Werkzeuge über räumliche und kulturartspezifische Grenzen hinweg und unterstützen damit eine nachhaltigere, ressourcenschonende Landwirtschaft.