Saved in:
| Main Authors: | Chen, Junwen, Wang, Yingcheng, Yanai, Keiji |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2307.02291 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
by: Chen, Junwen, et al.
Published: (2025)
by: Chen, Junwen, et al.
Published: (2025)
PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing
by: Xiong, Peilin, et al.
Published: (2025)
by: Xiong, Peilin, et al.
Published: (2025)
BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing
by: Xiong, Peilin, et al.
Published: (2026)
by: Xiong, Peilin, et al.
Published: (2026)
A DeNoising FPN With Transformer R-CNN for Tiny Object Detection
by: Liu, Hou-I, et al.
Published: (2024)
by: Liu, Hou-I, et al.
Published: (2024)
Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection
by: Qiu, Yicheng, et al.
Published: (2026)
by: Qiu, Yicheng, et al.
Published: (2026)
Point-MF: One-step Point Cloud Generation from a Single Image via Mean Flows
by: Baba, Yuta, et al.
Published: (2026)
by: Baba, Yuta, et al.
Published: (2026)
U-DECN: End-to-End Underwater Object Detection ConvNet with Improved DeNoising Training
by: Liu, Zhuoyan, et al.
Published: (2024)
by: Liu, Zhuoyan, et al.
Published: (2024)
SceneTextStylizer: A Training-Free Scene Text Style Transfer Framework with Diffusion Model
by: Yuan, Honghui, et al.
Published: (2025)
by: Yuan, Honghui, et al.
Published: (2025)
PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models
by: Chen, Junwen, et al.
Published: (2025)
by: Chen, Junwen, et al.
Published: (2025)
Mono3DV: Monocular 3D Object Detection with 3D-Aware Bipartite Matching and Variational Query DeNoising
by: Vu, Kiet Dang, et al.
Published: (2026)
by: Vu, Kiet Dang, et al.
Published: (2026)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
by: Tao, Yiyi, et al.
Published: (2024)
by: Tao, Yiyi, et al.
Published: (2024)
Sample what you cant compress
by: Birodkar, Vighnesh, et al.
Published: (2024)
by: Birodkar, Vighnesh, et al.
Published: (2024)
SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding
by: Gomi, Keisuke, et al.
Published: (2026)
by: Gomi, Keisuke, et al.
Published: (2026)
From Image to Video, what do we need in multimodal LLMs?
by: Huang, Suyuan, et al.
Published: (2024)
by: Huang, Suyuan, et al.
Published: (2024)
Attend to what I say: Highlighting relevant content on slides
by: M, Megha Mariam K, et al.
Published: (2026)
by: M, Megha Mariam K, et al.
Published: (2026)
Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift
by: Chen, Lixian, et al.
Published: (2026)
by: Chen, Lixian, et al.
Published: (2026)
MultiAnimate: Pose-Guided Image Animation Made Extensible
by: Hu, Yingcheng, et al.
Published: (2026)
by: Hu, Yingcheng, et al.
Published: (2026)
3D Scene Graph Guided Vision-Language Pre-training
by: Liu, Hao, et al.
Published: (2024)
by: Liu, Hao, et al.
Published: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
by: Li, Qingqiu, et al.
Published: (2024)
by: Li, Qingqiu, et al.
Published: (2024)
CheXLearner: Text-Guided Fine-Grained Representation Learning for Progression Detection
by: Wang, Yuanzhuo, et al.
Published: (2025)
by: Wang, Yuanzhuo, et al.
Published: (2025)
SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding
by: Tong, Yujia, et al.
Published: (2026)
by: Tong, Yujia, et al.
Published: (2026)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
by: Liu, Jihao, et al.
Published: (2024)
by: Liu, Jihao, et al.
Published: (2024)
Benford's law: what does it say on adversarial images?
by: Zago, João G., et al.
Published: (2021)
by: Zago, João G., et al.
Published: (2021)
Do not trust what you trust: Miscalibration in Semi-supervised Learning
by: Mishra, Shambhavi, et al.
Published: (2024)
by: Mishra, Shambhavi, et al.
Published: (2024)
SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models
by: Wang, Haobo, et al.
Published: (2026)
by: Wang, Haobo, et al.
Published: (2026)
Rethinking Cross-Dose PET Denoising: Mitigating Averaging Effects via Residual Noise Learning
by: Liu, Yichao, et al.
Published: (2026)
by: Liu, Yichao, et al.
Published: (2026)
Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
by: Fang, Yixiong, et al.
Published: (2024)
by: Fang, Yixiong, et al.
Published: (2024)
Giving each task what it needs -- leveraging structured sparsity for tailored multi-task learning
by: Upadhyay, Richa, et al.
Published: (2024)
by: Upadhyay, Richa, et al.
Published: (2024)
Attend what matters: Leveraging vision foundational models for breast cancer classification using mammograms
by: Sanghvi, Samyak, et al.
Published: (2026)
by: Sanghvi, Samyak, et al.
Published: (2026)
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
by: Liu, Che, et al.
Published: (2023)
by: Liu, Che, et al.
Published: (2023)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
by: Xue, Wei, et al.
Published: (2026)
by: Xue, Wei, et al.
Published: (2026)
TeLL Me what you cant see
by: Cavasin, Saverio, et al.
Published: (2025)
by: Cavasin, Saverio, et al.
Published: (2025)
The Global-Local loop: what is missing in bridging the gap between geospatial data from numerous communities?
by: Mallet, Clément, et al.
Published: (2026)
by: Mallet, Clément, et al.
Published: (2026)
Flexible image analysis for law enforcement agencies with deep neural networks to determine: where, who and what
by: Bouma, Henri, et al.
Published: (2024)
by: Bouma, Henri, et al.
Published: (2024)
DM-FNet: Unified multimodal medical image fusion via diffusion process-trained encoder-decoder
by: He, Dan, et al.
Published: (2025)
by: He, Dan, et al.
Published: (2025)
MMSpec: Benchmarking Speculative Decoding for Vision-Language Models
by: Shen, Hui, et al.
Published: (2026)
by: Shen, Hui, et al.
Published: (2026)
Vision-language models for decoding provider attention during neonatal resuscitation
by: Parodi, Felipe, et al.
Published: (2024)
by: Parodi, Felipe, et al.
Published: (2024)
Understanding when spatial transformer networks do not support invariance, and what to do about it
by: Finnveden, Lukas, et al.
Published: (2020)
by: Finnveden, Lukas, et al.
Published: (2020)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
by: Che, Chengan, et al.
Published: (2026)
by: Che, Chengan, et al.
Published: (2026)
Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
by: Vedernikov, Alexander, et al.
Published: (2025)
by: Vedernikov, Alexander, et al.
Published: (2025)
Similar Items
-
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
by: Chen, Junwen, et al.
Published: (2025) -
PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing
by: Xiong, Peilin, et al.
Published: (2025) -
BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing
by: Xiong, Peilin, et al.
Published: (2026) -
A DeNoising FPN With Transformer R-CNN for Tiny Object Detection
by: Liu, Hou-I, et al.
Published: (2024) -
Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection
by: Qiu, Yicheng, et al.
Published: (2026)