视觉定位新标杆:EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现

发布时间:2026/7/22 0:30:35
视觉定位新标杆:EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现 视觉定位新标杆EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8BEGM-Qwen3-VL-8B作为EGMEfficient Visual Grounding Language Models系列的旗舰模型在视觉定位领域实现了重大突破。该模型基于Qwen3-VL-8B-Thinking构建通过两阶段训练 pipeline监督微调SFT强化学习GRPO在RefCOCO基准测试中达到91.4的平均IoU较基础模型提升3.6个百分点同时保持高效推理性能。 核心性能突破RefCOCO基准测试结果ModelRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCOg valRefCOCOg testAvgQwen3-VL-8B-Thinking91.092.586.686.291.280.587.888.687.8EGM-Qwen3-VL-8B93.995.691.290.593.586.390.891.491.4Qwen3-VL-235B-A22B-Instruct90.494.682.286.492.178.590.590.588.2Qwen3-VL-235B-A22B-Thinking93.494.190.689.591.485.290.490.590.7这一成绩不仅超越了同尺寸的基础模型甚至优于参数量更大的Qwen3-VL-235B系列90.7平均IoU同时实现了5.9倍的推理速度提升737ms vs 4,320ms平均延迟。 技术创新点高效视觉定位机制小模型与大模型的视觉编码器通常相同性能差距主要源于文本理解能力的差异。研究表明62.8%的小模型错误源于复杂提示中的多关系描述理解不足。EGM通过生成大量中等质量的推理token成功匹配大模型生成少量高成本token的性能。两阶段训练流程SFT阶段使用专有VLM为视觉定位训练数据生成详细的思维链推理步骤基础模型在此数据上进行微调SFT checkpointnvidia/EGM-8B-SFTRL阶段应用GRPOGroup Relative Policy Optimization强化学习算法结合IoU和任务成功指标的奖励函数进一步提升定位精度⚡ 快速开始指南模型下载pip install -U huggingface_hub huggingface-cli download nvidia/EGM-8B --local-dir ./models/EGM-8B使用SGLang进行推理启动服务pip install sglang[all]0.5.5 python -m sglang.launch_server \ --model-path nvidia/EGM-8B \ --chat-templateqwen3-vl \ --port 30000发送视觉定位请求import openai import base64 client openai.Client(base_urlhttp://127.0.0.1:30000/v1, api_keyEMPTY) # 加载本地图片为base64格式 with open(example.jpg, rb) as f: image_base64 base64.b64encode(f.read()).decode(utf-8) response client.chat.completions.create( modelnvidia/EGM-8B, messages[ { role: user, content: [ {type: image_url, image_url: {url: fdata:image/jpeg;base64,{image_base64}}}, {type: text, text: Please provide the bounding box coordinate of the region this sentence describes: the person on the left.}, ], } ], temperature0.6, top_p0.95, max_tokens8192, ) print(response.choices[0].message.content) 模型架构组件详情架构Qwen3VLForConditionalGeneration文本隐藏层大小4096文本层数36注意力头数328个KV头文本中间层大小12,288视觉隐藏层大小1152视觉层数27patch大小16 x 16最大位置嵌入262,144词汇表大小151,936 引用article{zhan2026EGM, author {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng}, title {EGM: Efficient Visual Grounding Language Models}, booktitle {arXiv}, year {2026} } 致谢本项目受益于Qwen3-VL、InternVL、verl和verl-internvl等开源项目。通过结合高效的训练方法和创新的推理策略EGM-Qwen3-VL-8B为视觉定位任务树立了新的标杆证明了小模型在特定优化下可以媲美甚至超越大模型的性能同时保持更快的推理速度。这一突破为视觉定位技术的实际应用开辟了更广阔的前景。【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻