CoolFace
Apppublic

XaviXva/Video-LLaVA

sourceHugging Faceapache-2.0updated 3y agoView on Hugging Face
0likes
builder.py49 linesDownload Raw Back to multimodal_encoder
1import os2from .clip_encoder import CLIPVisionTower3from .languagebind import LanguageBindImageTower, LanguageBindVideoTower4from .mae_encoder import MAEVisionTower5from transformers import CLIPModel6 7def build_image_tower(image_tower_cfg, **kwargs):8    image_tower = getattr(image_tower_cfg, 'mm_image_tower', getattr(image_tower_cfg, 'image_tower', None))9    is_absolute_path_exists = os.path.exists(image_tower)10    if is_absolute_path_exists or image_tower.startswith("openai") or image_tower.startswith("laion"):11        return CLIPVisionTower(image_tower, args=image_tower_cfg, **kwargs)12    if image_tower.endswith('LanguageBind_Image'):13        return LanguageBindImageTower(image_tower, args=image_tower_cfg, cache_dir='./cache_dir', **kwargs)14    if 'mae' in image_tower:15        print('maemaemaemaemaemaemaemae')16        print('maemaemaemaemaemaemaemae')17        print('maemaemaemaemaemaemaemae')18        print('maemaemaemaemaemaemaemae')19        print('maemaemaemaemaemaemaemae')20        return MAEVisionTower(image_tower, args=image_tower_cfg, cache_dir='./cache_dir', **kwargs)21    raise ValueError(f'Unknown image tower: {image_tower}')22 23def build_video_tower(video_tower_cfg, **kwargs):24    video_tower = getattr(video_tower_cfg, 'mm_video_tower', getattr(video_tower_cfg, 'video_tower', None))25    if video_tower.endswith('LanguageBind_Video_merge'):26        return LanguageBindVideoTower(video_tower, args=video_tower_cfg, cache_dir='./cache_dir', **kwargs)27    raise ValueError(f'Unknown video tower: {video_tower}')28 29 30 31# import os32# from .clip_encoder import CLIPVisionTower33# from .languagebind import LanguageBindImageTower, LanguageBindVideoTower34# from transformers import CLIPModel35 36# def build_image_tower(image_tower_cfg, **kwargs):37#     image_tower = getattr(image_tower_cfg, 'mm_image_tower', getattr(image_tower_cfg, 'image_tower', None))38#     is_absolute_path_exists = os.path.exists(image_tower)39#     if is_absolute_path_exists or image_tower.startswith("openai") or image_tower.startswith("laion"):40#         return CLIPVisionTower(image_tower, args=image_tower_cfg, **kwargs)41#     if image_tower.endswith('LanguageBind_Image'):42#         return LanguageBindImageTower(image_tower, args=image_tower_cfg, cache_dir='./cache_dir', **kwargs)43#     raise ValueError(f'Unknown image tower: {image_tower}')44 45# def build_video_tower(video_tower_cfg, **kwargs):46#     video_tower = getattr(video_tower_cfg, 'mm_video_tower', getattr(video_tower_cfg, 'video_tower', None))47#     if video_tower.endswith('LanguageBind_Video'):48#         return LanguageBindVideoTower(video_tower, args=video_tower_cfg, cache_dir='./cache_dir', **kwargs)49#     raise ValueError(f'Unknown video tower: {video_tower}')