感谢你们出色的工作和详细的 FAQ。我按照 README/FAQ 操作,用官方的开源权重在VideoMME上进行测评,但始终比论文报告(表 2,“密集帧采样”,含字幕)中 LongVT-7B-SFT 在 VideoMME 上的 64.9% 低了约 11 %。我已经排除了 FAQ 中列出的常见问题,因此我将报告完整设置和已检查的内容,以防我遗漏了某个配置细节。
结果
| 指标 |
数值 |
| 确定性准确率(严格字母匹配) |
0.3974 |
| 使用 LLM 评判的准确率(Qwen2.5-72B-Instruct) |
0.5367 |
| 格式得分 |
0.7256 |
| 论文表 2(LongVT-7B-SFT,VideoMME 含字幕,密集采样) |
64.9 |
按时长划分(评判准确率):短视频 65.4% / 中等视频 53.2% / 长视频 42.3%。短视频基本复现;全部差距都出现在中等视频,尤其是长视频中。这个结果在我约 7 次运行中都很稳定(得分都在 52–54% 之间)。
环境 / 确切配置
- 模型:已发布 LongVT-7B-SFT 检查点(SFT 版本,基础模型为 Qwen2.5-VL-7B-Instruct)
- 任务:
videomme_w_subtitle_reward_tool(已验证字幕确实被注入:2700 个样本中有 2232 个包含真实字幕文本;其余样本的数据集中没有 .srt)
- 推理(vLLM serve):vLLM 0.12.0,
--chat-template examples/eval/tool_call_qwen2_5_vl.jinja,--tool-call-parser hermes,--enable-auto-tool-choice,TP=4
- 客户端(
async_openai):fps=1, max_frames=768, max_pixels=50176, is_qwen3_vl=False, num_cpus=1, timeout=12000
- 解码:贪心(
do_sample=False,temperature=0)
max_new_tokens:49152(依据 FAQ Q2.5)
- 运行规模:完整 2700 个样本,
accelerate --num_processes=4
- 评判模型:
Qwen2.5-72B-Instruct,本地独立端口提供服务,USE_LLM_JUDGE=True
FAQ 中已检查并确认不是原因的问题
- ✅ 任务名称是
videomme_w_subtitle_reward_tool(已确认提示中包含了字幕)。
- ✅
IS_QWEN3_VL=False。
- ✅ vLLM 0.12.0 + 提供的聊天模板 + hermes 解析器。
- ✅
max_new_tokens=49152(只有 2.2% 的响应缺少 <answer> 标签或被截断)。
- ✅ 完整的 2700 个样本(未使用
--limit)。
- ✅ MCP
crop_video 路径处理正常(使用干净的绝对路径;已配置前导斜杠的回退方案)。
- ✅ hermes 工具解析器的 JSON 错误极少:在长达 8 小时的运行中,仅 8 / 2455 个工具调用样本(0.3%)出现
JSONDecodeError。
- ✅ 评判模型计分偏低不是问题所在:72B 评判模型已经几乎恢复了所有“用选项文本而非字母回答”的情况;只有约 10 个“答案字面等于正确选项文本但得分仍为 0”的样本残留。
问题
- 评判模型:报告中的 64.9 分是使用 Qwen3-235B-A22B 还是 Qwen2.5-72B-Instruct 生成的?对于 SFT 模型,评判模型的选择大约会使 VideoMME 分数移动多少个百分点?(我的分数差距主要集中在中等/长视频上,而这也正是开放式/语义密集型视频。)
- 帧数(密集采样 = {512, 768} 中的最佳值):对于 LongVT-7B-SFT 而言,64.9 分是基于 512 帧还是 768 帧?512 帧与 768 帧之间的分数差异有多大?(我目前只有 768 帧的结果 = 53.7;512 帧的运行正在进行中。)
- 长视频上的工具行为:在我的运行中,长视频上的
crop_video 表现退化——78% 的裁剪起始时间 <1 秒(典型窗口为 [0, ~32秒],而视频长度为 30–60 分钟),单次裁剪且无精细化,工具没有带来提升(无裁剪准确率 0.469 > 起始锚定裁剪准确率 0.408)。这是已发布 SFT 检查点的预期行为吗?还是说它应该能进行时间定位?另外,对于 Qwen2.5-VL(is_qwen3_vl=False)路径,全局帧是以无时间标记的独立 image_url 形式发送的,每帧的时间戳标记(<X seconds>)仅在 Qwen3-VL 路径中添加——那么 SFT 模型在评估时是否依赖任何时间戳/帧时间信号来确定裁剪时间?
- 我们是否还遗漏了实现 64.9 分的其他设置细节(系统提示变体、评判模型投票次数、像素预算等)?
所使用的系统提示(来自 lmms_eval_tasks/videomme/utils.py):
"You are a helpful assistant. When the user asks a question, your response must include two parts: first, the reasoning process enclosed in <think>...</think> tags, then the final answer enclosed in <answer>...</answer> tags. ..."
另外附上完整的推理 JSON 文件
20260204_234358_samples_videomme_reward_tool.json
20260622_102318_results.json
谢谢!
感谢你们出色的工作和详细的 FAQ。我按照 README/FAQ 操作,用官方的开源权重在VideoMME上进行测评,但始终比论文报告(表 2,“密集帧采样”,含字幕)中 LongVT-7B-SFT 在 VideoMME 上的 64.9% 低了约 11 %。我已经排除了 FAQ 中列出的常见问题,因此我将报告完整设置和已检查的内容,以防我遗漏了某个配置细节。
结果
按时长划分(评判准确率):短视频 65.4% / 中等视频 53.2% / 长视频 42.3%。短视频基本复现;全部差距都出现在中等视频,尤其是长视频中。这个结果在我约 7 次运行中都很稳定(得分都在 52–54% 之间)。
环境 / 确切配置
videomme_w_subtitle_reward_tool(已验证字幕确实被注入:2700 个样本中有 2232 个包含真实字幕文本;其余样本的数据集中没有.srt)--chat-template examples/eval/tool_call_qwen2_5_vl.jinja,--tool-call-parser hermes,--enable-auto-tool-choice,TP=4async_openai):fps=1, max_frames=768, max_pixels=50176, is_qwen3_vl=False, num_cpus=1, timeout=12000do_sample=False,temperature=0)max_new_tokens:49152(依据 FAQ Q2.5)accelerate --num_processes=4Qwen2.5-72B-Instruct,本地独立端口提供服务,USE_LLM_JUDGE=TrueFAQ 中已检查并确认不是原因的问题
videomme_w_subtitle_reward_tool(已确认提示中包含了字幕)。IS_QWEN3_VL=False。max_new_tokens=49152(只有 2.2% 的响应缺少<answer>标签或被截断)。--limit)。crop_video路径处理正常(使用干净的绝对路径;已配置前导斜杠的回退方案)。JSONDecodeError。问题
crop_video表现退化——78% 的裁剪起始时间 <1 秒(典型窗口为[0, ~32秒],而视频长度为 30–60 分钟),单次裁剪且无精细化,工具没有带来提升(无裁剪准确率 0.469 > 起始锚定裁剪准确率 0.408)。这是已发布 SFT 检查点的预期行为吗?还是说它应该能进行时间定位?另外,对于 Qwen2.5-VL(is_qwen3_vl=False)路径,全局帧是以无时间标记的独立image_url形式发送的,每帧的时间戳标记(<X seconds>)仅在 Qwen3-VL 路径中添加——那么 SFT 模型在评估时是否依赖任何时间戳/帧时间信号来确定裁剪时间?所使用的系统提示(来自
lmms_eval_tasks/videomme/utils.py):另外附上完整的推理 JSON 文件
20260204_234358_samples_videomme_reward_tool.json
20260622_102318_results.json
谢谢!