Video spatial reasoning is essential for navigation-oriented perception and long-video question answering, where models must infer spatial relations across long horizons under changing viewpoints. However, existing multimodal large language models (MLLMs) remain largely semantic-…
Manual mango variety classification is time-consuming, error-prone, and contributes significantly to post-harvest losses in developing economies. This study aims to develop a computationally efficient and highly accurate artificial intelligence framework for automated mango varie…