This multimodal AI demo uses Salesforce/blip-vqa-base to answer natural-language questions about uploaded images. It combines computer vision and natural language processing.