Using Left and Right Brains Together: Towards Vision and Language Planning
Fuente:
arXiv
Salvato in:
| Autori principali: | Cen, Jun, Wu, Chenfei, Liu, Xiao, Yin, Shengming, Pei, Yixuan, Yang, Jinglong, Chen, Qifeng, Duan, Nan, Zhang, Jianguo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Continual Learning for Segment Anything Model Adaptation
di: Yang, Jinglong, et al.
Pubblicazione: (2024)
di: Yang, Jinglong, et al.
Pubblicazione: (2024)
BridgeTower: Building Bridges Between Encoders in Vision-Language Representation Learning
di: Xu, Xiao, et al.
Pubblicazione: (2022)
di: Xu, Xiao, et al.
Pubblicazione: (2022)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
StrokeNUWA: Tokenizing Strokes for Vector Graphic Synthesis
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
di: Kong, Fei, et al.
Pubblicazione: (2025)
di: Kong, Fei, et al.
Pubblicazione: (2025)
SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality
di: Lei, Chenyang, et al.
Pubblicazione: (2024)
di: Lei, Chenyang, et al.
Pubblicazione: (2024)
LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
di: Stan, Gabriela Ben Melech, et al.
Pubblicazione: (2024)
di: Stan, Gabriela Ben Melech, et al.
Pubblicazione: (2024)
PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
di: He, Runze, et al.
Pubblicazione: (2025)
di: He, Runze, et al.
Pubblicazione: (2025)
SimMAT: Exploring Transferability from Vision Foundation Models to Any Image Modality
di: Lei, Chenyang, et al.
Pubblicazione: (2024)
di: Lei, Chenyang, et al.
Pubblicazione: (2024)
Cross-Chirality Palmprint Verification: Left is Right for the Right Palmprint
di: Gao, Chengrui, et al.
Pubblicazione: (2024)
di: Gao, Chengrui, et al.
Pubblicazione: (2024)
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
di: Yin, Shengming, et al.
Pubblicazione: (2025)
di: Yin, Shengming, et al.
Pubblicazione: (2025)
Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection
di: Lee, Pei-Kang, et al.
Pubblicazione: (2025)
di: Lee, Pei-Kang, et al.
Pubblicazione: (2025)
HORIZON: High-Resolution Semantically Controlled Panorama Synthesis
di: Yan, Kun, et al.
Pubblicazione: (2022)
di: Yan, Kun, et al.
Pubblicazione: (2022)
Are We on the Right Way for Evaluating Large Vision-Language Models?
di: Chen, Lin, et al.
Pubblicazione: (2024)
di: Chen, Lin, et al.
Pubblicazione: (2024)
Left-Right Symmetry Breaking in CLIP-style Vision-Language Models Trained on Synthetic Spatial-Relation Data
di: Yamamoto, Takaki, et al.
Pubblicazione: (2026)
di: Yamamoto, Takaki, et al.
Pubblicazione: (2026)
Low-resolution Prior Equilibrium Network for CT Reconstruction
di: Yang, Yijie, et al.
Pubblicazione: (2024)
di: Yang, Yijie, et al.
Pubblicazione: (2024)
Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
di: Li, Yuanbo, et al.
Pubblicazione: (2026)
di: Li, Yuanbo, et al.
Pubblicazione: (2026)
Egocentric Vision Language Planning
di: Fang, Zhirui, et al.
Pubblicazione: (2024)
di: Fang, Zhirui, et al.
Pubblicazione: (2024)
FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
di: Yuan, Shengming, et al.
Pubblicazione: (2025)
di: Yuan, Shengming, et al.
Pubblicazione: (2025)
AutoDirector: Online Auto-scheduling Agents for Multi-sensory Composition
di: Ni, Minheng, et al.
Pubblicazione: (2024)
di: Ni, Minheng, et al.
Pubblicazione: (2024)
Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence
di: Zhang, Junyi, et al.
Pubblicazione: (2023)
di: Zhang, Junyi, et al.
Pubblicazione: (2023)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
Left Brain. Right Brain. Whole Brain
di: Farmer, Lesley S. J.
Pubblicazione: (2004)
di: Farmer, Lesley S. J.
Pubblicazione: (2004)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
Classification Done Right for Vision-Language Pre-Training
di: Huang, Zilong, et al.
Pubblicazione: (2024)
di: Huang, Zilong, et al.
Pubblicazione: (2024)
Medverse: A Universal Model for Full-Resolution 3D Medical Image Segmentation, Transformation and Enhancement
di: Hu, Jiesi, et al.
Pubblicazione: (2025)
di: Hu, Jiesi, et al.
Pubblicazione: (2025)
LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
di: Cao, Chenjie, et al.
Pubblicazione: (2023)
di: Cao, Chenjie, et al.
Pubblicazione: (2023)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
di: Ming, Yifei, et al.
Pubblicazione: (2024)
di: Ming, Yifei, et al.
Pubblicazione: (2024)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
di: Meng, Tian, et al.
Pubblicazione: (2024)
di: Meng, Tian, et al.
Pubblicazione: (2024)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
di: Yang, Jie, et al.
Pubblicazione: (2025)
di: Yang, Jie, et al.
Pubblicazione: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
QuoVLA: Quotient Space for Vision-Language-Action Models
di: Wang, Xuan, et al.
Pubblicazione: (2026)
di: Wang, Xuan, et al.
Pubblicazione: (2026)
Show, Don't Tell: Morphing Latent Reasoning into Image Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2026)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2026)
Diffutoon: High-Resolution Editable Toon Shading via Diffusion Models
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
Towards Vision-Language-Garment Models for Web Knowledge Garment Understanding and Generation
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation
di: Xue, Xizhe, et al.
Pubblicazione: (2025)
di: Xue, Xizhe, et al.
Pubblicazione: (2025)
MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
SeMoLi: What Moves Together Belongs Together
di: Seidenschwarz, Jenny, et al.
Pubblicazione: (2024)
di: Seidenschwarz, Jenny, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Continual Learning for Segment Anything Model Adaptation
di: Yang, Jinglong, et al.
Pubblicazione: (2024) -
BridgeTower: Building Bridges Between Encoders in Vision-Language Representation Learning
di: Xu, Xiao, et al.
Pubblicazione: (2022) -
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025) -
StrokeNUWA: Tokenizing Strokes for Vector Graphic Synthesis
di: Tang, Zecheng, et al.
Pubblicazione: (2024) -
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
di: Kong, Fei, et al.
Pubblicazione: (2025)