Guardado en:
| Autores principales: | Lan, Guanzhou, Liao, Chenyi, Yang, Yuqi, Ma, Qianli, Wang, Zhigang, Wang, Dong, Zhao, Bin, Li, Xuelong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.04565 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Night-to-Day Translation via Illumination Degradation Disentanglement
por: Lan, Guanzhou, et al.
Publicado: (2024)
por: Lan, Guanzhou, et al.
Publicado: (2024)
Efficient Diffusion as Low Light Enhancer
por: Lan, Guanzhou, et al.
Publicado: (2024)
por: Lan, Guanzhou, et al.
Publicado: (2024)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
por: Wang, Zhigang, et al.
Publicado: (2024)
por: Wang, Zhigang, et al.
Publicado: (2024)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
por: Zhang, Pingrui, et al.
Publicado: (2025)
por: Zhang, Pingrui, et al.
Publicado: (2025)
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
por: Zhang, Da, et al.
Publicado: (2025)
por: Zhang, Da, et al.
Publicado: (2025)
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
por: Yan, Chi, et al.
Publicado: (2023)
por: Yan, Chi, et al.
Publicado: (2023)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
por: Wu, Pengyuan, et al.
Publicado: (2026)
por: Wu, Pengyuan, et al.
Publicado: (2026)
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
por: Gao, Xianqiang, et al.
Publicado: (2026)
por: Gao, Xianqiang, et al.
Publicado: (2026)
RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
por: Gao, Bingjie, et al.
Publicado: (2025)
por: Gao, Bingjie, et al.
Publicado: (2025)
Point-PEFT: Parameter-Efficient Fine-Tuning for 3D Pre-trained Models
por: Tang, Yiwen, et al.
Publicado: (2023)
por: Tang, Yiwen, et al.
Publicado: (2023)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
por: Yang, Shuai, et al.
Publicado: (2025)
por: Yang, Shuai, et al.
Publicado: (2025)
Beyond Retraining: Training-Free Unknown Class Filtering for Source-Free Open Set Domain Adaptation of Vision-Language Models
por: Li, Yongguang, et al.
Publicado: (2025)
por: Li, Yongguang, et al.
Publicado: (2025)
LightBSR: Towards Lightweight Blind Super-Resolution via Discriminative Implicit Degradation Representation Learning
por: Yuan, Jiang, et al.
Publicado: (2025)
por: Yuan, Jiang, et al.
Publicado: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
por: Wang, Fengshun, et al.
Publicado: (2026)
por: Wang, Fengshun, et al.
Publicado: (2026)
SpatialBot: Precise Spatial Understanding with Vision Language Models
por: Cai, Wenxiao, et al.
Publicado: (2024)
por: Cai, Wenxiao, et al.
Publicado: (2024)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic Segmentation
por: Jing, Linglin, et al.
Publicado: (2024)
por: Jing, Linglin, et al.
Publicado: (2024)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
Degradation-Aware Image Enhancement via Vision-Language Classification
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
GLAD: Generalizable Tuning for Vision-Language Models
por: Peng, Yuqi, et al.
Publicado: (2025)
por: Peng, Yuqi, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
por: Liu, Junli, et al.
Publicado: (2025)
por: Liu, Junli, et al.
Publicado: (2025)
LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Rendering and Control
por: Qu, Delin, et al.
Publicado: (2024)
por: Qu, Delin, et al.
Publicado: (2024)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
Vehicle Perception from Satellite
por: Zhao, Bin, et al.
Publicado: (2024)
por: Zhao, Bin, et al.
Publicado: (2024)
Enhanced Continual Learning of Vision-Language Models with Model Fusion
por: Gao, Haoyuan, et al.
Publicado: (2025)
por: Gao, Haoyuan, et al.
Publicado: (2025)
SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
por: Zhang, Junjie, et al.
Publicado: (2024)
por: Zhang, Junjie, et al.
Publicado: (2024)
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
por: Yao, Yuanqi, et al.
Publicado: (2025)
por: Yao, Yuanqi, et al.
Publicado: (2025)
Transferable 3D Adversarial Shape Completion using Diffusion Models
por: Dai, Xuelong, et al.
Publicado: (2024)
por: Dai, Xuelong, et al.
Publicado: (2024)
EVLM: An Efficient Vision-Language Model for Visual Understanding
por: Chen, Kaibing, et al.
Publicado: (2024)
por: Chen, Kaibing, et al.
Publicado: (2024)
Enhance Vision-Language Alignment with Noise
por: Huang, Sida, et al.
Publicado: (2024)
por: Huang, Sida, et al.
Publicado: (2024)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
Improving Transferable Targeted Attacks with Feature Tuning Mixup
por: Liang, Kaisheng, et al.
Publicado: (2024)
por: Liang, Kaisheng, et al.
Publicado: (2024)
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
por: Zhang, Pingrui, et al.
Publicado: (2025)
por: Zhang, Pingrui, et al.
Publicado: (2025)
Gradient-Free Adversarial Purification with Diffusion Models
por: Dai, Xuelong, et al.
Publicado: (2025)
por: Dai, Xuelong, et al.
Publicado: (2025)
Any2Point: Empowering Any-modality Large Models for Efficient 3D Understanding
por: Tang, Yiwen, et al.
Publicado: (2024)
por: Tang, Yiwen, et al.
Publicado: (2024)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
por: Ma, Jingtian, et al.
Publicado: (2025)
por: Ma, Jingtian, et al.
Publicado: (2025)
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
por: Li, Yueyan, et al.
Publicado: (2025)
por: Li, Yueyan, et al.
Publicado: (2025)
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
por: Zhuang, Chenyi, et al.
Publicado: (2024)
por: Zhuang, Chenyi, et al.
Publicado: (2024)
Ejemplares similares
-
Night-to-Day Translation via Illumination Degradation Disentanglement
por: Lan, Guanzhou, et al.
Publicado: (2024) -
Efficient Diffusion as Low Light Enhancer
por: Lan, Guanzhou, et al.
Publicado: (2024) -
Open-Vocabulary Octree-Graph for 3D Scene Understanding
por: Wang, Zhigang, et al.
Publicado: (2024) -
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
por: Zhang, Pingrui, et al.
Publicado: (2025) -
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
por: Zhang, Da, et al.
Publicado: (2025)