Valley2: Exploring Multimodal Models with Scalable Vision-Language Design
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Ziheng, Chen, Zhenghao, Luo, Ruipu, Zhang, Can, Gao, Yuan, He, Zhentao, Wang, Xian, Lin, Haoran, Qiu, Minghui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
di: He, Zhentao, et al.
Pubblicazione: (2025)
di: He, Zhentao, et al.
Pubblicazione: (2025)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Valley: Video Assistant with Large Language model Enhanced abilitY
di: Luo, Ruipu, et al.
Pubblicazione: (2023)
di: Luo, Ruipu, et al.
Pubblicazione: (2023)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
di: Li, Zejun, et al.
Pubblicazione: (2024)
di: Li, Zejun, et al.
Pubblicazione: (2024)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
di: Yu, Jiachen, et al.
Pubblicazione: (2025)
di: Yu, Jiachen, et al.
Pubblicazione: (2025)
MMVP: A Multimodal MoCap Dataset with Vision and Pressure Sensors
di: Zhang, He, et al.
Pubblicazione: (2024)
di: Zhang, He, et al.
Pubblicazione: (2024)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
di: Wu, Ruipu, et al.
Pubblicazione: (2025)
di: Wu, Ruipu, et al.
Pubblicazione: (2025)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
di: Sun, Zhihao, et al.
Pubblicazione: (2024)
di: Sun, Zhihao, et al.
Pubblicazione: (2024)
Accurate and Scalable Multimodal Pathology Retrieval via Attentive Vision-Language Alignment
di: Wang, Hongyi, et al.
Pubblicazione: (2025)
di: Wang, Hongyi, et al.
Pubblicazione: (2025)
FashionLOGO: Prompting Multimodal Large Language Models for Fashion Logo Embeddings
di: Wang, Zhen, et al.
Pubblicazione: (2023)
di: Wang, Zhen, et al.
Pubblicazione: (2023)
Online Self-Calibration Against Hallucination in Vision-Language Models
di: Chen, Minghui, et al.
Pubblicazione: (2026)
di: Chen, Minghui, et al.
Pubblicazione: (2026)
QuoVLA: Quotient Space for Vision-Language-Action Models
di: Wang, Xuan, et al.
Pubblicazione: (2026)
di: Wang, Xuan, et al.
Pubblicazione: (2026)
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
Exploring Scalable Unified Modeling for General Low-Level Vision
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
PathInsight: Instruction Tuning of Multimodal Datasets and Models for Intelligence Assisted Diagnosis in Histopathology
di: Wu, Xiaomin, et al.
Pubblicazione: (2024)
di: Wu, Xiaomin, et al.
Pubblicazione: (2024)
DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models
di: Lin, Jieru, et al.
Pubblicazione: (2024)
di: Lin, Jieru, et al.
Pubblicazione: (2024)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
di: Dong, Xiangyu, et al.
Pubblicazione: (2025)
di: Dong, Xiangyu, et al.
Pubblicazione: (2025)
Anchor-based Robust Finetuning of Vision-Language Models
di: Han, Jinwei, et al.
Pubblicazione: (2024)
di: Han, Jinwei, et al.
Pubblicazione: (2024)
Towards Multimodal In-Context Learning for Vision & Language Models
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
Task-Focused Memorization for Multimodal Agents
di: Zou, Tao, et al.
Pubblicazione: (2026)
di: Zou, Tao, et al.
Pubblicazione: (2026)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
di: Wang, Shengkang, et al.
Pubblicazione: (2024)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
di: Luo, Yaxin, et al.
Pubblicazione: (2024)
di: Luo, Yaxin, et al.
Pubblicazione: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
Semantic Alignment for Multimodal Large Language Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
di: Fu, Pei, et al.
Pubblicazione: (2025)
di: Fu, Pei, et al.
Pubblicazione: (2025)
Efficient Multimodal Dataset Distillation via Generative Models
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation
di: Yang, Ling, et al.
Pubblicazione: (2023)
di: Yang, Ling, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
di: Li, Yifan, et al.
Pubblicazione: (2025) -
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
di: He, Zhentao, et al.
Pubblicazione: (2025) -
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
di: Zhan, Yufei, et al.
Pubblicazione: (2025) -
Valley: Video Assistant with Large Language model Enhanced abilitY
di: Luo, Ruipu, et al.
Pubblicazione: (2023) -
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
di: Li, Zejun, et al.
Pubblicazione: (2024)