TroL: Traversal of Layers for Large Language and Vision Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Byung-Kwan, Chung, Sangyun, Kim, Chae Won, Park, Beomchan, Ro, Yong Man |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Phantom of Latent for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
CoLLaVO: Crayon Large Language and Vision mOdel
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)
por: Yu, Youngjoon, et al.
Publicado: (2024)
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion
por: Kim, Taeheon, et al.
Publicado: (2024)
por: Kim, Taeheon, et al.
Publicado: (2024)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
por: Chung, Sangyun, et al.
Publicado: (2024)
por: Chung, Sangyun, et al.
Publicado: (2024)
Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
por: Park, Beomchan, et al.
Publicado: (2026)
por: Park, Beomchan, et al.
Publicado: (2026)
Causal Unsupervised Semantic Segmentation
por: Kim, Junho, et al.
Publicado: (2023)
por: Kim, Junho, et al.
Publicado: (2023)
Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language
por: Yeo, Jeong Hun, et al.
Publicado: (2024)
por: Yeo, Jeong Hun, et al.
Publicado: (2024)
Unified Reinforcement and Imitation Learning for Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
por: Kim, Junho, et al.
Publicado: (2024)
por: Kim, Junho, et al.
Publicado: (2024)
MSCoTDet: Language-driven Multi-modal Fusion for Improved Multispectral Pedestrian Detection
por: Kim, Taeheon, et al.
Publicado: (2024)
por: Kim, Taeheon, et al.
Publicado: (2024)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
Recursive Think-Answer Process for LLMs and VLMs
por: Lee, Byung-Kwan, et al.
Publicado: (2026)
por: Lee, Byung-Kwan, et al.
Publicado: (2026)
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
por: Park, Sungjune, et al.
Publicado: (2023)
por: Park, Sungjune, et al.
Publicado: (2023)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
por: Lee, Seongyun, et al.
Publicado: (2024)
por: Lee, Seongyun, et al.
Publicado: (2024)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
por: Kim, Dain, et al.
Publicado: (2026)
por: Kim, Dain, et al.
Publicado: (2026)
ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language Models
por: Wan, Zifu, et al.
Publicado: (2025)
por: Wan, Zifu, et al.
Publicado: (2025)
Intriguing Properties of Large Language and Vision Models
por: Lee, Young-Jun, et al.
Publicado: (2024)
por: Lee, Young-Jun, et al.
Publicado: (2024)
Robust Pedestrian Detection via Constructing Versatile Pedestrian Knowledge Bank
por: Park, Sungjune, et al.
Publicado: (2024)
por: Park, Sungjune, et al.
Publicado: (2024)
Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge
por: Kim, Minsu, et al.
Publicado: (2023)
por: Kim, Minsu, et al.
Publicado: (2023)
Persona Extraction Through Semantic Similarity for Emotional Support Conversation Generation
por: Han, Seunghee, et al.
Publicado: (2024)
por: Han, Seunghee, et al.
Publicado: (2024)
Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing
por: Yeo, Jeong Hun, et al.
Publicado: (2024)
por: Yeo, Jeong Hun, et al.
Publicado: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024)
por: Lee, Kang-il, et al.
Publicado: (2024)
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
por: Yu, Seonghoon, et al.
Publicado: (2026)
por: Yu, Seonghoon, et al.
Publicado: (2026)
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
por: Ju, Jeongho, et al.
Publicado: (2024)
por: Ju, Jeongho, et al.
Publicado: (2024)
Toward Interactive Regional Understanding in Vision-Large Language Models
por: Lee, Jungbeom, et al.
Publicado: (2024)
por: Lee, Jungbeom, et al.
Publicado: (2024)
Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition
por: Kim, Minsu, et al.
Publicado: (2023)
por: Kim, Minsu, et al.
Publicado: (2023)
Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning
por: Park, Sungjune, et al.
Publicado: (2026)
por: Park, Sungjune, et al.
Publicado: (2026)
Do Vision-Language Models Understand Visual Persuasiveness?
por: Park, Gyuwon
Publicado: (2025)
por: Park, Gyuwon
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
por: Min, Kyungmin, et al.
Publicado: (2024)
por: Min, Kyungmin, et al.
Publicado: (2024)
Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
por: Byun, Sanghyun, et al.
Publicado: (2025)
por: Byun, Sanghyun, et al.
Publicado: (2025)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
por: Kim, Jeonghwan, et al.
Publicado: (2024)
por: Kim, Jeonghwan, et al.
Publicado: (2024)
Ejemplares similares
-
Phantom of Latent for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024) -
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024) -
CoLLaVO: Crayon Large Language and Vision mOdel
por: Lee, Byung-Kwan, et al.
Publicado: (2024) -
MoAI: Mixture of All Intelligence for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024) -
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)