SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yue, Tongtian, Cheng, Jie, Guo, Longteng, Dai, Xingyuan, Zhao, Zijia, He, Xingjian, Xiong, Gang, Lv, Yisheng, Liu, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
par: Yue, Tongtian, et autres
Publié: (2025)
par: Yue, Tongtian, et autres
Publié: (2025)
BrainGPT: Unleashing the Potential of EEG Generalist Foundation Model by Autoregressive Pre-training
par: Yue, Tongtian, et autres
Publié: (2024)
par: Yue, Tongtian, et autres
Publié: (2024)
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024)
par: Hu, Erdong, et autres
Publié: (2024)
Ada-K Routing: Boosting the Efficiency of MoE-based LLMs
par: Yue, Tongtian, et autres
Publié: (2024)
par: Yue, Tongtian, et autres
Publié: (2024)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
par: Cheng, Jie, et autres
Publié: (2024)
par: Cheng, Jie, et autres
Publié: (2024)
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
par: Wang, Wenxuan, et autres
Publié: (2023)
par: Wang, Wenxuan, et autres
Publié: (2023)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
Efficient Motion-Aware Video MLLM
par: Zhao, Zijia, et autres
Publié: (2025)
par: Zhao, Zijia, et autres
Publié: (2025)
ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval
par: Zhao, Zijia, et autres
Publié: (2024)
par: Zhao, Zijia, et autres
Publié: (2024)
SUMO-MCP: Leveraging the Model Context Protocol for Autonomous Traffic Simulation and Optimization
par: Ye, Chenglong, et autres
Publié: (2025)
par: Ye, Chenglong, et autres
Publié: (2025)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
par: Zhao, Zijia, et autres
Publié: (2024)
par: Zhao, Zijia, et autres
Publié: (2024)
Offline Reinforcement Learning with Discrete Diffusion Skills
par: Qiao, RuiXi, et autres
Publié: (2025)
par: Qiao, RuiXi, et autres
Publié: (2025)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2024)
par: Zhang, Enming, et autres
Publié: (2024)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2025)
par: Zhang, Enming, et autres
Publié: (2025)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
VRoPE: Rotary Position Embedding for Video Large Language Models
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
par: Guo, Longteng, et autres
Publié: (2026)
par: Guo, Longteng, et autres
Publié: (2026)
Hierarchical Self-Prompting SAM: A Prompt-Free Medical Image Segmentation Framework
par: Zhang, Mengmeng, et autres
Publié: (2025)
par: Zhang, Mengmeng, et autres
Publié: (2025)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
par: Cheng, Jie, et autres
Publié: (2025)
par: Cheng, Jie, et autres
Publié: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
par: Jiao, Yang, et autres
Publié: (2024)
par: Jiao, Yang, et autres
Publié: (2024)
Context-Aware Probabilistic Modeling with LLM for Multimodal Time Series Forecasting
par: Yao, Yueyang, et autres
Publié: (2025)
par: Yao, Yueyang, et autres
Publié: (2025)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
par: Guo, Longteng, et autres
Publié: (2026)
par: Guo, Longteng, et autres
Publié: (2026)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)
par: Ma, Jiatong, et autres
Publié: (2026)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
par: Xuan, Shiyu, et autres
Publié: (2023)
par: Xuan, Shiyu, et autres
Publié: (2023)
S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding
par: Wang, He, et autres
Publié: (2026)
par: Wang, He, et autres
Publié: (2026)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
par: Zhu, Zilin, et autres
Publié: (2026)
par: Zhu, Zilin, et autres
Publié: (2026)
COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing
par: Wang, Jiangshan, et autres
Publié: (2024)
par: Wang, Jiangshan, et autres
Publié: (2024)
Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models
par: Qin, Yulei, et autres
Publié: (2024)
par: Qin, Yulei, et autres
Publié: (2024)
Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency
par: Hong, Colin, et autres
Publié: (2025)
par: Hong, Colin, et autres
Publié: (2025)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
par: Cheng, Jie, et autres
Publié: (2024)
par: Cheng, Jie, et autres
Publié: (2024)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
par: Mei, Yanghong, et autres
Publié: (2025)
par: Mei, Yanghong, et autres
Publié: (2025)
VL-Mamba: Exploring State Space Models for Multimodal Learning
par: Qiao, Yanyuan, et autres
Publié: (2024)
par: Qiao, Yanyuan, et autres
Publié: (2024)
Circular Programs and Self-Referential Structures
par: Allison, Lloyd
Publié: (2024)
par: Allison, Lloyd
Publié: (2024)
Instruction Tuning Chronologically Consistent Language Models
par: He, Songrun, et autres
Publié: (2025)
par: He, Songrun, et autres
Publié: (2025)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
par: Li, Handong, et autres
Publié: (2025)
par: Li, Handong, et autres
Publié: (2025)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
par: Li, Handong, et autres
Publié: (2026)
par: Li, Handong, et autres
Publié: (2026)
Self-Supervised Multi-Object Tracking with Path Consistency
par: Lu, Zijia, et autres
Publié: (2024)
par: Lu, Zijia, et autres
Publié: (2024)
Documents similaires
-
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
par: Yue, Tongtian, et autres
Publié: (2025) -
BrainGPT: Unleashing the Potential of EEG Generalist Foundation Model by Autoregressive Pre-training
par: Yue, Tongtian, et autres
Publié: (2024) -
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024) -
Ada-K Routing: Boosting the Efficiency of MoE-based LLMs
par: Yue, Tongtian, et autres
Publié: (2024) -
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
par: Cheng, Jie, et autres
Publié: (2024)