arxivcs.CV2026-07-17
When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?
Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He, Leonid Sigal
3D CT vision-language models (VLMs) classify abnormalities from text prompts in a zero-shot manner, enabling cross-institution deployment where labels are scarce and clinical tasks shift faster than supervised models can be retrained. A real CT scan, however, typically contains s…