HF RL Explorer

任务:使用 VLMEvalKit 评测模型在 OCRBench 上的表现

任务:使用 VLMEvalKit 评测模型在 OCRBench 上的表现: a task in WildClawBench-Harbor (Harbor dataset). 【评测目标】 待评测模型:gpt-5-mini-2025-08-07(OpenAI API 模型) 评测基准:OCRBench(原始版本v1,注意不是 OCRBenchV2)

Part of internlm/WildClawBench-Harbor.