您好!非常感谢您分享优秀的工作!
我在尝试复现LLaVA-Video-7B,CLIP score的实验,遇到了一些问题希望能向您请教:
- 在VideoMME上,使用您给出的frames.json能复现出65.6的结果
- 但是我使用相同的CLIP Model:openai/clip-vit-base-patch32,进行计算score的时候,发现score和您给出的score相差非常大,尤其是长视频部分,我这边计算出的score和您给出的score相似度非常差。(如下图)
这直接导致我目前使用CLIP从头复现出的结果为:
video Type: short: 76.6%
video Type: medium: 63.2%
video Type: long: 52.4%
| Tasks |
Filter |
n-shot |
Metric |
|
Value |
|
Stderr |
| videomme_clip |
none |
0 |
videomme_percetion_score |
↑ |
64.0741 |
± |
N/A |
和论文中相差很大,甚至低于uniform。想请教这个不一致性可能是什么原因导致的?
如果我有理解不当的地方,还请指正。再次感谢您的工作与分享!
我目前使用的实验配置为:
RTX5090 32GB
MLLM:LLaVA-Video-7B
CLIP Model:openai/clip-vit-base-patch32
Benchmark:VideoMME
脚本:feature_extract.py 使用CLIP计算score,frame_select.py 找关键帧,使用默认参数
您好!非常感谢您分享优秀的工作!
我在尝试复现LLaVA-Video-7B,CLIP score的实验,遇到了一些问题希望能向您请教:
这直接导致我目前使用CLIP从头复现出的结果为:
video Type: short: 76.6%
video Type: medium: 63.2%
video Type: long: 52.4%
和论文中相差很大,甚至低于uniform。想请教这个不一致性可能是什么原因导致的?
如果我有理解不当的地方,还请指正。再次感谢您的工作与分享!
我目前使用的实验配置为:
RTX5090 32GB
MLLM:LLaVA-Video-7B
CLIP Model:openai/clip-vit-base-patch32
Benchmark:VideoMME
脚本:feature_extract.py 使用CLIP计算score,frame_select.py 找关键帧,使用默认参数