POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Lanyun, Chen, Tianrun, Xu, Qianxiong, Liu, Xuanyi, Ji, Deyi, Wu, Haiyang, Soh, De Wen, Liu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
LLaFS: When Large Language Models Meet Few-Shot Segmentation
di: Zhu, Lanyun, et al.
Pubblicazione: (2023)
di: Zhu, Lanyun, et al.
Pubblicazione: (2023)
Not Every Patch is Needed: Towards a More Efficient and Effective Backbone for Video-based Person Re-identification
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
Hybrid Mamba for Few-Shot Segmentation
di: Xu, Qianxiong, et al.
Pubblicazione: (2024)
di: Xu, Qianxiong, et al.
Pubblicazione: (2024)
Unlocking the Power of SAM 2 for Few-Shot Segmentation
di: Xu, Qianxiong, et al.
Pubblicazione: (2025)
di: Xu, Qianxiong, et al.
Pubblicazione: (2025)
IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
di: Zhu, Lanyun, et al.
Pubblicazione: (2024)
di: Zhu, Lanyun, et al.
Pubblicazione: (2024)
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
di: Liu, Xuanyi, et al.
Pubblicazione: (2026)
di: Liu, Xuanyi, et al.
Pubblicazione: (2026)
Video-Zero: Self-Evolution Video Understanding
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
Breaking the Box: Enhancing Remote Sensing Image Segmentation with Freehand Sketches
di: Zang, Ying, et al.
Pubblicazione: (2025)
di: Zang, Ying, et al.
Pubblicazione: (2025)
SAM3-Adapter: Efficient Adaptation of Segment Anything 3 for Camouflage Object Segmentation, Shadow Detection, and Medical Image Segmentation
di: Chen, Tianrun, et al.
Pubblicazione: (2025)
di: Chen, Tianrun, et al.
Pubblicazione: (2025)
xLSTM-UNet can be an Effective 2D & 3D Medical Image Segmentation Backbone with Vision-LSTM (ViL) better than its Mamba Counterpart
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation
di: Zang, Ying, et al.
Pubblicazione: (2026)
di: Zang, Ying, et al.
Pubblicazione: (2026)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
Discrete Latent Perspective Learning for Segmentation and Detection
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
Let Human Sketches Help: Empowering Challenging Image Segmentation Task with Freehand Sketches
di: Zang, Ying, et al.
Pubblicazione: (2025)
di: Zang, Ying, et al.
Pubblicazione: (2025)
SAMITE: Position Prompted SAM2 with Calibrated Memory for Visual Object Tracking
di: Xu, Qianxiong, et al.
Pubblicazione: (2025)
di: Xu, Qianxiong, et al.
Pubblicazione: (2025)
From Air to Wear: Personalized 3D Digital Fashion with AR/VR Immersive 3D Sketching
di: Zang, Ying, et al.
Pubblicazione: (2025)
di: Zang, Ying, et al.
Pubblicazione: (2025)
RAVEN: Robust Advertisement Video Violation Temporal Grounding via Reinforcement Reasoning
di: Ji, Deyi, et al.
Pubblicazione: (2025)
di: Ji, Deyi, et al.
Pubblicazione: (2025)
Uncertainty-Based Ensemble Learning in CMR Semantic Segmentation
di: Liu, Yiwei, et al.
Pubblicazione: (2025)
di: Liu, Yiwei, et al.
Pubblicazione: (2025)
RESMatch: Referring Expression Segmentation in a Semi-Supervised Manner
di: Zang, Ying, et al.
Pubblicazione: (2024)
di: Zang, Ying, et al.
Pubblicazione: (2024)
Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors
di: Zang, Ying, et al.
Pubblicazione: (2026)
di: Zang, Ying, et al.
Pubblicazione: (2026)
StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference
di: Huang, Zhaohong, et al.
Pubblicazione: (2026)
di: Huang, Zhaohong, et al.
Pubblicazione: (2026)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
di: Hwang, Yerin, et al.
Pubblicazione: (2025)
di: Hwang, Yerin, et al.
Pubblicazione: (2025)
IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning
di: Zhao, Mengyang, et al.
Pubblicazione: (2025)
di: Zhao, Mengyang, et al.
Pubblicazione: (2025)
HD-VGGT: High-Resolution Visual Geometry Transformer
di: Chen, Tianrun, et al.
Pubblicazione: (2026)
di: Chen, Tianrun, et al.
Pubblicazione: (2026)
LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation
di: Chen, Hanning, et al.
Pubblicazione: (2025)
di: Chen, Hanning, et al.
Pubblicazione: (2025)
Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
di: Peng, Jihua, et al.
Pubblicazione: (2025)
di: Peng, Jihua, et al.
Pubblicazione: (2025)
PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
di: Zou, Quanchen, et al.
Pubblicazione: (2025)
di: Zou, Quanchen, et al.
Pubblicazione: (2025)
View-Centric Multi-Object Tracking with Homographic Matching in Moving UAV
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
MedM-VL: What Makes a Good Medical LVLM?
di: Shi, Yiming, et al.
Pubblicazione: (2025)
di: Shi, Yiming, et al.
Pubblicazione: (2025)
Structural and Statistical Texture Knowledge Distillation and Learning for Segmentation
di: Ji, Deyi, et al.
Pubblicazione: (2025)
di: Ji, Deyi, et al.
Pubblicazione: (2025)
Syllables to Scenes: Literary-Guided Free-Viewpoint 3D Scene Synthesis from Japanese Haiku
di: Yu, Chunan, et al.
Pubblicazione: (2025)
di: Yu, Chunan, et al.
Pubblicazione: (2025)
Eliminating Feature Ambiguity for Few-Shot Segmentation
di: Xu, Qianxiong, et al.
Pubblicazione: (2024)
di: Xu, Qianxiong, et al.
Pubblicazione: (2024)
PPTFormer: Pseudo Multi-Perspective Transformer for UAV Segmentation
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation
di: Garcia, Fernando Gabriela, et al.
Pubblicazione: (2025)
di: Garcia, Fernando Gabriela, et al.
Pubblicazione: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
di: Zhu, Lanyun, et al.
Pubblicazione: (2025) -
LLaFS: When Large Language Models Meet Few-Shot Segmentation
di: Zhu, Lanyun, et al.
Pubblicazione: (2023) -
Not Every Patch is Needed: Towards a More Efficient and Effective Backbone for Video-based Person Re-identification
di: Zhu, Lanyun, et al.
Pubblicazione: (2025) -
Hybrid Mamba for Few-Shot Segmentation
di: Xu, Qianxiong, et al.
Pubblicazione: (2024) -
Unlocking the Power of SAM 2 for Few-Shot Segmentation
di: Xu, Qianxiong, et al.
Pubblicazione: (2025)