Logo Lanfrica

Leomezjayson/Audio-Visual-Fusion-African-Roads

Domain:

mobility

Record type:

project
Creator:
Leo
Host:
Dynamic Audio-Visual Fusion for Hazard Prediction in Unstructured Environments # Audio-Visual-Fusion-African-Roads Dynamic Audio-Visual Fusion for Hazard Prediction in Unstructured Environments # SenseAI Research β€” Audio-Visual Fusion for African Road Safety > **"Hearing dangers before they are seen."** --- ## πŸ“Œ Overview This repository contains the research code for my undergraduate thesis: **"Dynamic Audio-Visual Fusion for Proactive Collision Avoidance in Unstructured African Traffic Environments."** **The Problem:** Existing autonomous vehicle perception systems (trained on Western datasets like nuScenes and Waymo) fail in African road conditions characterized by: - Unpredictable pedestrian and motorcycle behavior - Obstructed visibility (dust, rain, nighttime) - Chaotic lane discipline - High ambient noise **Our Hypothesis:** Fusing vision with **real-time audio cues** (emergency sirens, tire screeches, breaking glass, honk patterns) can improve hazard detection accuracy in low-visibility scenarios by over 15%. **Key Contribution:** We propose a novel, lightweight fusion mechanism that dynamically increases audio weighting when visual confidence falls below a learned threshold. --- ## πŸ—ΊοΈ Roadmap - [x] Repository Setup - [ ] Data Collection Pipeline (Local African Traffic Recording) - [ ] Audio-Visual Dataset Annotation - [ ] Baseline Vision Model (ResNet50 + YOLOv8) - [ ] Baseline Audio Model (VGGish + Audio Transformers) - [ ] Late Fusion Implementation - [ ] Dynamic Confidence-Based Fusion (Novel Contribution) - [ ] Edge Deployment (TensorFlow Lite / ONNX) - [ ] Thesis Submission - [ ] Conference Paper Submission (ICLR Africa / CVPR Workshop) --- ## πŸ—οΈ Architecture Overview ``` β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β” β”‚ SENSEAI RESEARCH PIPELINE β”‚ β”œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€ β”‚ β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β” β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β” β”‚ β”‚ β”‚ Vision Encoder β”‚ β”‚ Audio Encoder β”‚ β”‚ β”‚ β”‚ (ResN …