update visual genome

2025-04-04 18:10:47 +00:00 · 2023-10-24 23:49:23 +03:00 · 2023-10-24 23:49:23 +03:00 · f976c7800f
commit f976c7800f
parent 83c3cb06ed
11 changed files with 18 additions and 16 deletions
--- a/dataset/README_MINIGPTv2_FINETUNE.md
+++ b/dataset/README_MINIGPTv2_FINETUNE.md
@ -7,16 +7,16 @@ Image source | Download path
 --- | :---:
 COCO 2014 images | <a href="http://images.cocodataset.org/zips/train2014.zip">images</a> &nbsp;&nbsp;  <a href="https://storage.googleapis.com/sfr-vision-language-research/datasets/coco_karpathy_train.json"> captions</a>
 COCO VQA | <a href="https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/vqav2/vqa_train.json">vqa train</a> &nbsp;&nbsp;  <a href="https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/vqav2/vqa_val.json"> vqa val</a>
-Visual Genome |  <a href="https://cs.stanford.edu/people/rak248/VG_100K_2/images.zip">images part1</a> <a href="https://cs.stanford.edu/people/rak248/VG_100K_2/images2.zip">images part2</a>
+Visual Genome |  <a href="https://cs.stanford.edu/people/rak248/VG_100K_2/images.zip">images part1</a> &nbsp;&nbsp; <a href="https://cs.stanford.edu/people/rak248/VG_100K_2/images2.zip">images part2</a> &nbsp;&nbsp; <a href="https://homes.cs.washington.edu/~ranjay/visualgenome/data/dataset/image_data.json.zip"> image meta data </a>
 TextCaps | <a href="https://cs.stanford.edu/people/rak248/VG_100K_2/images.zip">images</a>  &nbsp;&nbsp; <a href="https://dl.fbaipublicfiles.com/textvqa/data/textcaps/TextCaps_0.1_train.json"> annotations</a> 
 RefCOCO | <a href="https://bvisionweb1.cs.unc.edu/licheng/referit/data/refcoco.zip"> annotations </a>
 RefCOCO+ | <a href="https://bvisionweb1.cs.unc.edu/licheng/referit/data/refcoco+.zip"> annotations </a>
 RefCOCOg | <a href="https://bvisionweb1.cs.unc.edu/licheng/referit/data/refcocog.zip"> annotations </a>
 OKVQA | <a href="https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/okvqa/okvqa_train.json"> annotations </a>
-AOK-VQA | <a href="https://prior-datasets.s3.us-east-2.amazonaws.com/aokvqa/aokvqa_v1p0.tar.gz"> annotations </a>
+AOK-VQA | <a href="https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/aokvqa/aokvqa_v1p0_train.json"> annotations </a>
 OCR-VQA | <a href="https://drive.google.com/drive/folders/1_GYPY5UkUy7HIcR0zq3ZCFgeZN7BAfm_?usp=sharing"> annotations </a>
 GQA | <a href="https://downloads.cs.stanford.edu/nlp/data/gqa/images.zip">images</a>  &nbsp;&nbsp; <a href="/ibex/project/c2133/minigpt4_v2_dataset/gqa/annotations/train_balanced_questions.json"> annotations </a>
-Filtered Flickr-30k |  <a href="https://drive.google.com/drive/folders/19c_ggBI77AvdtYlPbuI0ZpnPz73T5teX?usp=sharing"> annotations </a>
+Filtered flickr-30k |  <a href="https://drive.google.com/drive/folders/19c_ggBI77AvdtYlPbuI0ZpnPz73T5teX?usp=sharing"> annotations </a>
 Multi-task conversation |  <a href="https://drive.google.com/file/d/11HHqB2c29hbSk-WLxdta-nG8UCUrcCN1/view?usp=sharing"> annotations </a> 
 Filtered unnatural instruction |  <a href="https://drive.google.com/file/d/1lXNnBcb5WU-sc8Fe2T2N8J0NRw4sBLev/view?usp=sharing"> annotations </a>
 LLaVA | <a href="https://huggingface.co/datasets/liuhaotian/LLaVA-Instruct-150K/resolve/main/complex_reasoning_77k.json"> Compelex reasoning </a> &nbsp;&nbsp;<a href="https://huggingface.co/datasets/liuhaotian/LLaVA-Instruct-150K/resolve/main/detail_23k.json"> Detailed description </a> &nbsp;&nbsp; <a href="https://huggingface.co/datasets/liuhaotian/LLaVA-Instruct-150K/resolve/main/conversation_58k.json"> Conversation </a> 
@ -65,6 +65,8 @@ ${MINIGPTv2_DATASET}
 │   ├── VG_100K
 │   ├── VG_100K_2
 │   └── region_descriptions.json
+│   └── image_data.json
+
 ...
 ```

--- a/minigpt4/configs/datasets/gqa/balanced_val.yaml
+++ b/minigpt4/configs/datasets/gqa/balanced_val.yaml
@ -28,6 +28,6 @@ datasets:
          url:
              - https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/gqa/train_balanced_questions.json
          storage:
-              - /ibex/project/c2133/minigpt4_v2_dataset/gqa/annotations/train_balanced_questions.json
+              - /ibex/project/c2090/minigptv2_dataset/gqa/train_balanced_questions.json
      images:
-          storage: /ibex/project/c2133/minigpt4_v2_dataset/gqa/images_copy/
+          storage: /ibex/project/c2090/minigptv2_dataset/gqa/images
--- a/minigpt4/configs/datasets/llava/conversation.yaml
+++ b/minigpt4/configs/datasets/llava/conversation.yaml
@ -9,4 +9,4 @@ datasets:
    data_type: images
    build_info:
      image_path: /ibex/reference/CV/COCO/cocoapi/data/2014/images/jpeg/train
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/llava/conversation_58k.json
+      ann_path: /ibex/project/c2090/minigptv2_dataset/llava/conversation_58k.json
--- a/minigpt4/configs/datasets/llava/detail.yaml
+++ b/minigpt4/configs/datasets/llava/detail.yaml
@ -9,4 +9,4 @@ datasets:
    data_type: images
    build_info:
      image_path: /ibex/reference/CV/COCO/cocoapi/data/2014/images/jpeg/train
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/llava/detail_23k.json
+      ann_path: /ibex/project/c2090/minigptv2_dataset/llava/detail_23k.json
--- a/minigpt4/configs/datasets/llava/reason.yaml
+++ b/minigpt4/configs/datasets/llava/reason.yaml
@ -9,4 +9,4 @@ datasets:
    data_type: images
    build_info:
      image_path: /ibex/reference/CV/COCO/cocoapi/data/2014/images/jpeg/train
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/llava/complex_reasoning_77k.json
+      ann_path: /ibex/project/c2090/minigptv2_dataset/llava/complex_reasoning_77k.json
--- a/minigpt4/configs/datasets/multitask_conversation/default.yaml
+++ b/minigpt4/configs/datasets/multitask_conversation/default.yaml
@ -11,4 +11,4 @@ datasets:
    build_info:
    
      image_path: /ibex/reference/CV/COCO/cocoapi/data/2014/images/jpeg/train
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/multitask_conversation/multi_task_conversation.json
+      ann_path: /ibex/project/c2090/minigptv2_dataset/multitask_conversation/multi_task_conversation.json
--- a/minigpt4/configs/datasets/nlp/unnatural_instruction.yaml
+++ b/minigpt4/configs/datasets/nlp/unnatural_instruction.yaml
@ -7,4 +7,4 @@ datasets:
  unnatural_instruction:
    data_type: text
    build_info:
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/unnatural-instructions/data/unnatural_instruction_filer.json
+      ann_path: /ibex/project/c2090/minigptv2_dataset/unnatural_instructions/unnatural_instruction_filer.json
--- a/minigpt4/configs/datasets/ocrvqa/ocrvqa.yaml
+++ b/minigpt4/configs/datasets/ocrvqa/ocrvqa.yaml
@ -8,5 +8,5 @@ datasets:
  ocrvqa:
    data_type: images
    build_info:
-      image_path: /ibex/project/c2133/minigpt4_v2_dataset/ocrvqa/images
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/ocrvqa/dataset.json
+      image_path: /ibex/project/c2090/minigptv2_dataset/ocrvqa/images
+      ann_path: /ibex/project/c2090/minigptv2_dataset/ocrvqa/dataset.json
--- a/minigpt4/configs/datasets/okvqa/defaults.yaml
+++ b/minigpt4/configs/datasets/okvqa/defaults.yaml
@ -31,6 +31,6 @@ datasets:
              # - https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/okvqa/OpenEnded_mscoco_train2014_questions.json
              # - https://storage.googleapis.com/sfr-vision-language-research/LAVIS/datasets/okvqa/mscoco_train2014_annotations.json
          storage:
-              - /ibex/project/c2133/minigpt4_v2_dataset/okvqa_v2/annotations/okvqa_train.json
+              - /ibex/project/c2090/minigptv2_dataset/okvqa/okvqa_train.json
      images:
          storage: /ibex/reference/CV/COCO/cocoapi/data/2014/images/jpeg
--- a/minigpt4/configs/datasets/textcaps/caption.yaml
+++ b/minigpt4/configs/datasets/textcaps/caption.yaml
@ -10,7 +10,7 @@ datasets:
    data_type: images
    
    build_info:
-      image_path: /ibex/project/c2133/minigpt4_v2_dataset/TextCaps/train_images
-      ann_path: /ibex/project/c2133/minigpt4_v2_dataset/TextCaps/TextCaps_0.1_train.json
+      image_path: /ibex/project/c2090/minigptv2_dataset/textcaps/train_images
+      ann_path: /ibex/project/c2090/minigptv2_dataset/textcaps/TextCaps_0.1_train.json


--- a/minigpt4/configs/datasets/vg/ref.yaml
+++ b/minigpt4/configs/datasets/vg/ref.yaml
@ -7,4 +7,4 @@ datasets:
  refvg:
    data_type: images
    build_info:
-      data_dir: /ibex/project/c2133/minigpt4_v2_dataset/visual_genome
+      data_dir: /ibex/project/c2090/minigptv2_dataset/visual_genome