LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Debnath, Soumyaratna, Manh, Bui Duc, Liu, Zinan, Wang, Lin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective
di: Manh, Bui Duc, et al.
Pubblicazione: (2025)
di: Manh, Bui Duc, et al.
Pubblicazione: (2025)
Adaptive Cache Enhancement for Test-Time Adaptation of Vision-Language Models
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2025)
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2025)
RASP: Revisiting 3D Anamorphic Art for Shadow-Guided Packing of Irregular Objects
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2025)
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2025)
L3D-Pose: Lifting Pose for 3D Avatars from a Single Camera in the Wild
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2025)
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2025)
STEP: Simultaneous Tracking and Estimation of Pose for Animals and Humans
di: Verma, Shashikant, et al.
Pubblicazione: (2025)
di: Verma, Shashikant, et al.
Pubblicazione: (2025)
YOWOv3: An Efficient and Generalized Framework for Human Action Detection and Recognition
di: Dang, Duc Manh Nguyen, et al.
Pubblicazione: (2024)
di: Dang, Duc Manh Nguyen, et al.
Pubblicazione: (2024)
Uncovering Cultural Representation Disparities in Vision-Language Models
di: Kadiyala, Ram Mohan Rao, et al.
Pubblicazione: (2025)
di: Kadiyala, Ram Mohan Rao, et al.
Pubblicazione: (2025)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
VisionKG: Unleashing the Power of Visual Datasets via Knowledge Graph
di: Yuan, Jicheng, et al.
Pubblicazione: (2023)
di: Yuan, Jicheng, et al.
Pubblicazione: (2023)
Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation
di: Bose, Sarosij, et al.
Pubblicazione: (2025)
di: Bose, Sarosij, et al.
Pubblicazione: (2025)
Representation Learning with Semantic-aware Instance and Sparse Token Alignments
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2026)
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2026)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
di: Han, Yuhang, et al.
Pubblicazione: (2026)
di: Han, Yuhang, et al.
Pubblicazione: (2026)
Training A Small Emotional Vision Language Model for Visual Art Comprehension
di: Zhang, Jing, et al.
Pubblicazione: (2024)
di: Zhang, Jing, et al.
Pubblicazione: (2024)
Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training
di: Kong, Quan, et al.
Pubblicazione: (2026)
di: Kong, Quan, et al.
Pubblicazione: (2026)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)
Collaborative Perceiver: Elevating Vision-based 3D Object Detection via Local Density-Aware Spatial Occupancy
di: Yuan, Jicheng, et al.
Pubblicazione: (2025)
di: Yuan, Jicheng, et al.
Pubblicazione: (2025)
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
di: Ye-Bin, Moon, et al.
Pubblicazione: (2025)
di: Ye-Bin, Moon, et al.
Pubblicazione: (2025)
Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models
di: Kawarada, Masayuki, et al.
Pubblicazione: (2025)
di: Kawarada, Masayuki, et al.
Pubblicazione: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
di: Lin, Zichuan, et al.
Pubblicazione: (2025)
di: Lin, Zichuan, et al.
Pubblicazione: (2025)
Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference
di: Cahyani, Putu Indah Githa, et al.
Pubblicazione: (2025)
di: Cahyani, Putu Indah Githa, et al.
Pubblicazione: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
Same or Not? Enhancing Visual Perception in Vision-Language Models
di: Marsili, Damiano, et al.
Pubblicazione: (2025)
di: Marsili, Damiano, et al.
Pubblicazione: (2025)
Volumetric Environment Representation for Vision-Language Navigation
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
di: Li, Yangfu, et al.
Pubblicazione: (2026)
di: Li, Yangfu, et al.
Pubblicazione: (2026)
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
di: Yadav, Ankit, et al.
Pubblicazione: (2025)
di: Yadav, Ankit, et al.
Pubblicazione: (2025)
Visual Representations inside the Language Model
di: Liu, Benlin, et al.
Pubblicazione: (2025)
di: Liu, Benlin, et al.
Pubblicazione: (2025)
An Intelligent Multi-task Supply Chain Model Based on Bio-inspired Networks
di: Khaleghi, Mehdi, et al.
Pubblicazione: (2025)
di: Khaleghi, Mehdi, et al.
Pubblicazione: (2025)
CLIPping the Deception: Adapting Vision-Language Models for Universal Deepfake Detection
di: Khan, Sohail Ahmed, et al.
Pubblicazione: (2024)
di: Khan, Sohail Ahmed, et al.
Pubblicazione: (2024)
See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model
di: Feng, Yixu, et al.
Pubblicazione: (2026)
di: Feng, Yixu, et al.
Pubblicazione: (2026)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
di: Dai, Haocheng, et al.
Pubblicazione: (2024)
di: Dai, Haocheng, et al.
Pubblicazione: (2024)
Visual-Advantage On-Policy Distillation for Vision-Language Models
di: Liu, Ruiqi, et al.
Pubblicazione: (2026)
di: Liu, Ruiqi, et al.
Pubblicazione: (2026)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
di: Chen, Bolei, et al.
Pubblicazione: (2025)
di: Chen, Bolei, et al.
Pubblicazione: (2025)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
di: Shang, Yuying, et al.
Pubblicazione: (2024)
di: Shang, Yuying, et al.
Pubblicazione: (2024)
Improving the Training of Rectified Flows
di: Lee, Sangyun, et al.
Pubblicazione: (2024)
di: Lee, Sangyun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective
di: Manh, Bui Duc, et al.
Pubblicazione: (2025) -
Adaptive Cache Enhancement for Test-Time Adaptation of Vision-Language Models
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2025) -
RASP: Revisiting 3D Anamorphic Art for Shadow-Guided Packing of Irregular Objects
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2025) -
L3D-Pose: Lifting Pose for 3D Avatars from a Single Camera in the Wild
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2025) -
STEP: Simultaneous Tracking and Estimation of Pose for Animals and Humans
di: Verma, Shashikant, et al.
Pubblicazione: (2025)