Skip to content

无法复现 LongVT-7B-SFT 在 VideoMME 上的结果 #25

Description

@Physicsmile

感谢你们出色的工作和详细的 FAQ。我按照 README/FAQ 操作,用官方的开源权重在VideoMME上进行测评,但始终比论文报告(表 2,“密集帧采样”,含字幕)中 LongVT-7B-SFT 在 VideoMME 上的 64.9% 低了约 11 %。我已经排除了 FAQ 中列出的常见问题,因此我将报告完整设置和已检查的内容,以防我遗漏了某个配置细节。

结果

指标 数值
确定性准确率(严格字母匹配) 0.3974
使用 LLM 评判的准确率(Qwen2.5-72B-Instruct) 0.5367
格式得分 0.7256
论文表 2(LongVT-7B-SFT,VideoMME 含字幕,密集采样) 64.9

按时长划分(评判准确率):短视频 65.4% / 中等视频 53.2% / 长视频 42.3%。短视频基本复现;全部差距都出现在中等视频,尤其是长视频中。这个结果在我约 7 次运行中都很稳定(得分都在 52–54% 之间)。

环境 / 确切配置

  • 模型:已发布 LongVT-7B-SFT 检查点(SFT 版本,基础模型为 Qwen2.5-VL-7B-Instruct)
  • 任务videomme_w_subtitle_reward_tool(已验证字幕确实被注入:2700 个样本中有 2232 个包含真实字幕文本;其余样本的数据集中没有 .srt
  • 推理(vLLM serve):vLLM 0.12.0--chat-template examples/eval/tool_call_qwen2_5_vl.jinja--tool-call-parser hermes--enable-auto-tool-choice,TP=4
  • 客户端(async_openaifps=1, max_frames=768, max_pixels=50176, is_qwen3_vl=False, num_cpus=1, timeout=12000
  • 解码:贪心(do_sample=Falsetemperature=0
  • max_new_tokens:49152(依据 FAQ Q2.5)
  • 运行规模:完整 2700 个样本,accelerate --num_processes=4
  • 评判模型Qwen2.5-72B-Instruct,本地独立端口提供服务,USE_LLM_JUDGE=True

FAQ 中已检查并确认不是原因的问题

  • ✅ 任务名称是 videomme_w_subtitle_reward_tool(已确认提示中包含了字幕)。
  • IS_QWEN3_VL=False
  • ✅ vLLM 0.12.0 + 提供的聊天模板 + hermes 解析器。
  • max_new_tokens=49152(只有 2.2% 的响应缺少 <answer> 标签或被截断)。
  • ✅ 完整的 2700 个样本(未使用 --limit)。
  • ✅ MCP crop_video 路径处理正常(使用干净的绝对路径;已配置前导斜杠的回退方案)。
  • ✅ hermes 工具解析器的 JSON 错误极少:在长达 8 小时的运行中,仅 8 / 2455 个工具调用样本(0.3%)出现 JSONDecodeError
  • ✅ 评判模型计分偏低不是问题所在:72B 评判模型已经几乎恢复了所有“用选项文本而非字母回答”的情况;只有约 10 个“答案字面等于正确选项文本但得分仍为 0”的样本残留。

问题

  1. 评判模型:报告中的 64.9 分是使用 Qwen3-235B-A22B 还是 Qwen2.5-72B-Instruct 生成的?对于 SFT 模型,评判模型的选择大约会使 VideoMME 分数移动多少个百分点?(我的分数差距主要集中在中等/长视频上,而这也正是开放式/语义密集型视频。)
  2. 帧数(密集采样 = {512, 768} 中的最佳值):对于 LongVT-7B-SFT 而言,64.9 分是基于 512 帧还是 768 帧?512 帧与 768 帧之间的分数差异有多大?(我目前只有 768 帧的结果 = 53.7;512 帧的运行正在进行中。)
  3. 长视频上的工具行为:在我的运行中,长视频上的 crop_video 表现退化——78% 的裁剪起始时间 <1 秒(典型窗口为 [0, ~32秒],而视频长度为 30–60 分钟),单次裁剪且无精细化,工具没有带来提升(无裁剪准确率 0.469 > 起始锚定裁剪准确率 0.408)。这是已发布 SFT 检查点的预期行为吗?还是说它应该能进行时间定位?另外,对于 Qwen2.5-VLis_qwen3_vl=False)路径,全局帧是以无时间标记的独立 image_url 形式发送的,每帧的时间戳标记(<X seconds>)仅在 Qwen3-VL 路径中添加——那么 SFT 模型在评估时是否依赖任何时间戳/帧时间信号来确定裁剪时间?
  4. 我们是否还遗漏了实现 64.9 分的其他设置细节(系统提示变体、评判模型投票次数、像素预算等)?

所使用的系统提示(来自 lmms_eval_tasks/videomme/utils.py):

"You are a helpful assistant. When the user asks a question, your response must include two parts: first, the reasoning process enclosed in <think>...</think> tags, then the final answer enclosed in <answer>...</answer> tags. ..."

另外附上完整的推理 JSON 文件

20260204_234358_samples_videomme_reward_tool.json
20260622_102318_results.json

谢谢!

Metadata

Metadata

Assignees

Labels

good first issueGood for newcomersquestionFurther information is requested

Type

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions