Enregistré dans:
| Auteurs principaux: | Cai, Kaiwen, Duan, Zhekai, Liu, Gaowen, Fleming, Charles, Lu, Chris Xiaoxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2403.04908 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Risk Controlled Image Retrieval
par: Cai, Kaiwen, et autres
Publié: (2023)
par: Cai, Kaiwen, et autres
Publié: (2023)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
par: Leng, Sicong, et autres
Publié: (2024)
par: Leng, Sicong, et autres
Publié: (2024)
Targeted Forgetting of Image Subgroups in CLIP Models
par: Zhang, Zeliang, et autres
Publié: (2025)
par: Zhang, Zeliang, et autres
Publié: (2025)
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
par: Sun, Changchang, et autres
Publié: (2025)
par: Sun, Changchang, et autres
Publié: (2025)
Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization
par: Peng, Jiangweizhi, et autres
Publié: (2024)
par: Peng, Jiangweizhi, et autres
Publié: (2024)
ThermoHands: A Benchmark for 3D Hand Pose Estimation from Egocentric Thermal Images
par: Ding, Fangqiang, et autres
Publié: (2024)
par: Ding, Fangqiang, et autres
Publié: (2024)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
par: Zhang, Renshan, et autres
Publié: (2025)
par: Zhang, Renshan, et autres
Publié: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
par: Zeng, Zhen, et autres
Publié: (2024)
par: Zeng, Zhen, et autres
Publié: (2024)
Visual Modality Prompt for Adapting Vision-Language Object Detectors
par: Medeiros, Heitor R., et autres
Publié: (2024)
par: Medeiros, Heitor R., et autres
Publié: (2024)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2025)
par: Gao, Bin-Bin, et autres
Publié: (2025)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
par: Zhou, Kaiwen, et autres
Publié: (2023)
par: Zhou, Kaiwen, et autres
Publié: (2023)
Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement
par: Khan, Zaid, et autres
Publié: (2024)
par: Khan, Zaid, et autres
Publié: (2024)
SOWA: Adapting Hierarchical Frozen Window Self-Attention to Visual-Language Models for Better Anomaly Detection
par: Hu, Zongxiang, et autres
Publié: (2024)
par: Hu, Zongxiang, et autres
Publié: (2024)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
par: Yang, Bufang, et autres
Publié: (2024)
par: Yang, Bufang, et autres
Publié: (2024)
Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images
par: Huang, Chaoqin, et autres
Publié: (2024)
par: Huang, Chaoqin, et autres
Publié: (2024)
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
Robust 3D Object Detection from LiDAR-Radar Point Clouds via Cross-Modal Feature Augmentation
par: Deng, Jianning, et autres
Publié: (2023)
par: Deng, Jianning, et autres
Publié: (2023)
SEP: Self-Enhanced Prompt Tuning for Visual-Language Model
par: Yao, Hantao, et autres
Publié: (2024)
par: Yao, Hantao, et autres
Publié: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2023)
par: Xiao, Linhui, et autres
Publié: (2023)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
Split to Merge: Unifying Separated Modalities for Unsupervised Domain Adaptation
par: Li, Xinyao, et autres
Publié: (2024)
par: Li, Xinyao, et autres
Publié: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
par: Jia, Mingkai, et autres
Publié: (2025)
par: Jia, Mingkai, et autres
Publié: (2025)
Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors
par: Tsagkas, Nikolaos, et autres
Publié: (2024)
par: Tsagkas, Nikolaos, et autres
Publié: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
VISC: mmWave Radar Scene Flow Estimation using Pervasive Visual-Inertial Supervision
par: Liu, Kezhong, et autres
Publié: (2025)
par: Liu, Kezhong, et autres
Publié: (2025)
TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
par: Chen, Zhekai, et autres
Publié: (2025)
par: Chen, Zhekai, et autres
Publié: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
par: HyperAI Team, et autres
Publié: (2025)
par: HyperAI Team, et autres
Publié: (2025)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
par: Jeon, Hyunsik, et autres
Publié: (2025)
par: Jeon, Hyunsik, et autres
Publié: (2025)
Large Language Models are Universal Reasoners for Visual Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
A Neurosymbolic Agent System for Compositional Visual Reasoning
par: Xu, Yichang, et autres
Publié: (2025)
par: Xu, Yichang, et autres
Publié: (2025)
PathoTune: Adapting Visual Foundation Model to Pathological Specialists
par: Lu, Jiaxuan, et autres
Publié: (2024)
par: Lu, Jiaxuan, et autres
Publié: (2024)
Visually-grounded Humanoid Agents
par: Ye, Hang, et autres
Publié: (2026)
par: Ye, Hang, et autres
Publié: (2026)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
par: Li, Xin, et autres
Publié: (2024)
par: Li, Xin, et autres
Publié: (2024)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
par: Xin, Yi, et autres
Publié: (2025)
par: Xin, Yi, et autres
Publié: (2025)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
par: Zhu, Lei, et autres
Publié: (2024)
par: Zhu, Lei, et autres
Publié: (2024)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
par: Bai, Yang, et autres
Publié: (2024)
par: Bai, Yang, et autres
Publié: (2024)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
par: Qian, Zhipeng, et autres
Publié: (2024)
par: Qian, Zhipeng, et autres
Publié: (2024)
Documents similaires
-
Risk Controlled Image Retrieval
par: Cai, Kaiwen, et autres
Publié: (2023) -
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
par: Leng, Sicong, et autres
Publié: (2024) -
Targeted Forgetting of Image Subgroups in CLIP Models
par: Zhang, Zeliang, et autres
Publié: (2025) -
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
par: Sun, Changchang, et autres
Publié: (2025) -
Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization
par: Peng, Jiangweizhi, et autres
Publié: (2024)