Skip to content

关于复现LLaVa-Next-Video-7B-Qwen2,CLIP,VideoMME上结果的疑问 #44

Description

@Lucas-Song-zero

您好!非常感谢您分享优秀的工作!
我在尝试复现LLaVA-Video-7B,CLIP score的实验,遇到了一些问题希望能向您请教:

  • 在VideoMME上,使用您给出的frames.json能复现出65.6的结果
  • 但是我使用相同的CLIP Model:openai/clip-vit-base-patch32,进行计算score的时候,发现score和您给出的score相差非常大,尤其是长视频部分,我这边计算出的score和您给出的score相似度非常差。(如下图)
Image

这直接导致我目前使用CLIP从头复现出的结果为:
video Type: short: 76.6%
video Type: medium: 63.2%
video Type: long: 52.4%

Tasks Filter n-shot Metric Value Stderr
videomme_clip none 0 videomme_percetion_score 64.0741 ± N/A

和论文中相差很大,甚至低于uniform。想请教这个不一致性可能是什么原因导致的?
如果我有理解不当的地方,还请指正。再次感谢您的工作与分享!

我目前使用的实验配置为:
RTX5090 32GB
MLLM:LLaVA-Video-7B
CLIP Model:openai/clip-vit-base-patch32
Benchmark:VideoMME
脚本:feature_extract.py 使用CLIP计算score,frame_select.py 找关键帧,使用默认参数

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions