arxivcs.ROcs.AI2026-06-30
A Modular Vision-Language-Action Robotics Framework for Indoor Environments
Anindya Jana, Snehasis Banerjee, Arup Sadhu, Ranjan Dasgupta
This paper presents an integrated system for the CMU Vision-Language-Action (VLA) Challenge, designed to enable an autonomous agent to perform complex tasks based on natural language instructions. Our framework employs a modular architecture that orchestrates environment mapping,…