Vision-Language Mini App

使用 Gradio + Transformers 展示三個常見任務:

  1. 影像描述(Image Captioning)
  2. 視覺問答(VQA)
  3. 影像-文字相似度(CLIP)

    首次推理會自動下載模型;在 Spaces 可用 CPU/ZeroGPU。

8 64