A Language Anchor-Guided Method for Robust Noisy Domain Generalization
Fuente:
arXiv
Salvato in:
| Autori principali: | Dai, Zilin, Wang, Lehong, Lin, Fangzhou, Wang, Yidong, Li, Zhigang, Yamada, Kazunori D, Zhang, Ziming, Lu, Wang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Strong View-Free Baseline Approach for Single-View Image Guided Point Cloud Completion
di: Lin, Fangzhou, et al.
Pubblicazione: (2025)
di: Lin, Fangzhou, et al.
Pubblicazione: (2025)
Self-Ensemble Post Learning for Noisy Domain Generalization
di: Lu, Wang, et al.
Pubblicazione: (2025)
di: Lu, Wang, et al.
Pubblicazione: (2025)
Hyperbolic Chamfer Distance for Point Cloud Completion and Beyond
di: Lin, Fangzhou, et al.
Pubblicazione: (2024)
di: Lin, Fangzhou, et al.
Pubblicazione: (2024)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
di: Huang, Yidong, et al.
Pubblicazione: (2025)
di: Huang, Yidong, et al.
Pubblicazione: (2025)
NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
di: Lin, Fangzhou, et al.
Pubblicazione: (2025)
di: Lin, Fangzhou, et al.
Pubblicazione: (2025)
AnchorOPT: Towards Optimizing Dynamic Anchors for Adaptive Prompt Learning
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
di: Li, Chenxu, et al.
Pubblicazione: (2025)
di: Li, Chenxu, et al.
Pubblicazione: (2025)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2026)
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2026)
Dynamic Token Reweighting for Robust Vision-Language Models
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
Grounding Language Models for Visual Entity Recognition
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a Service
di: Wang, Xiasi, et al.
Pubblicazione: (2025)
di: Wang, Xiasi, et al.
Pubblicazione: (2025)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
di: Shi, Dachuan, et al.
Pubblicazione: (2023)
di: Shi, Dachuan, et al.
Pubblicazione: (2023)
Towards Patronizing and Condescending Language in Chinese Videos: A Multimodal Dataset and Detector
di: Wang, Hongbo, et al.
Pubblicazione: (2024)
di: Wang, Hongbo, et al.
Pubblicazione: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning
di: Dai, Yinpei, et al.
Pubblicazione: (2024)
di: Dai, Yinpei, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
di: Zhang, Yin, et al.
Pubblicazione: (2026)
di: Zhang, Yin, et al.
Pubblicazione: (2026)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
di: Wang, Zihu, et al.
Pubblicazione: (2025)
di: Wang, Zihu, et al.
Pubblicazione: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
di: Cheng, Zihui, et al.
Pubblicazione: (2025)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
di: Wang, Zun, et al.
Pubblicazione: (2024)
di: Wang, Zun, et al.
Pubblicazione: (2024)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2023)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2023)
ZeroNLG: Aligning and Autoencoding Domains for Zero-Shot Multimodal and Multilingual Natural Language Generation
di: Yang, Bang, et al.
Pubblicazione: (2023)
di: Yang, Bang, et al.
Pubblicazione: (2023)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
di: Tian, Changyao, et al.
Pubblicazione: (2024)
di: Tian, Changyao, et al.
Pubblicazione: (2024)
The Mechanistic Emergence of Symbol Grounding in Language Models
di: Wu, Shuyu, et al.
Pubblicazione: (2025)
di: Wu, Shuyu, et al.
Pubblicazione: (2025)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
di: Fei, Senyu, et al.
Pubblicazione: (2025)
di: Fei, Senyu, et al.
Pubblicazione: (2025)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
di: Wang, Chenglin, et al.
Pubblicazione: (2026)
di: Wang, Chenglin, et al.
Pubblicazione: (2026)
Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media
di: Zhang, Zhizhen, et al.
Pubblicazione: (2024)
di: Zhang, Zhizhen, et al.
Pubblicazione: (2024)
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models
di: Zhang, Yikai, et al.
Pubblicazione: (2024)
di: Zhang, Yikai, et al.
Pubblicazione: (2024)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
di: You, Ling, et al.
Pubblicazione: (2025)
di: You, Ling, et al.
Pubblicazione: (2025)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
di: Lu, Songshuo, et al.
Pubblicazione: (2025)
di: Lu, Songshuo, et al.
Pubblicazione: (2025)
Understanding Hyperbolic Metric Learning through Hard Negative Sampling
di: Yue, Yun, et al.
Pubblicazione: (2024)
di: Yue, Yun, et al.
Pubblicazione: (2024)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
di: Mao, Zhiming, et al.
Pubblicazione: (2024)
di: Mao, Zhiming, et al.
Pubblicazione: (2024)
LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
di: Huang, Weiquan, et al.
Pubblicazione: (2024)
di: Huang, Weiquan, et al.
Pubblicazione: (2024)
Fast Prompt Alignment for Text-to-Image Generation
di: Mrini, Khalil, et al.
Pubblicazione: (2024)
di: Mrini, Khalil, et al.
Pubblicazione: (2024)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
di: Gu, Jihao, et al.
Pubblicazione: (2025)
di: Gu, Jihao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Strong View-Free Baseline Approach for Single-View Image Guided Point Cloud Completion
di: Lin, Fangzhou, et al.
Pubblicazione: (2025) -
Self-Ensemble Post Learning for Noisy Domain Generalization
di: Lu, Wang, et al.
Pubblicazione: (2025) -
Hyperbolic Chamfer Distance for Point Cloud Completion and Beyond
di: Lin, Fangzhou, et al.
Pubblicazione: (2024) -
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
di: Huang, Yidong, et al.
Pubblicazione: (2025) -
NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
di: Lin, Fangzhou, et al.
Pubblicazione: (2025)