Saved in:
| Main Authors: | Liu, Shih-Wen, Chen, Yen-Chang, Chu, Wei-Ta, Yang, Fu-En, Wang, Yu-Chiang Frank |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.21111 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
by: Liu, Shih-Wen, et al.
Published: (2025)
by: Liu, Shih-Wen, et al.
Published: (2025)
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
by: Huang, Chi-Pin, et al.
Published: (2025)
by: Huang, Chi-Pin, et al.
Published: (2025)
Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval
by: Chu, Xuangeng, et al.
Published: (2026)
by: Chu, Xuangeng, et al.
Published: (2026)
Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models
by: Yu, Yu-Chu, et al.
Published: (2024)
by: Yu, Yu-Chu, et al.
Published: (2024)
MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching
by: Wu, Yen-Siang, et al.
Published: (2025)
by: Wu, Yen-Siang, et al.
Published: (2025)
Segment Anything, Even Occluded
by: Tai, Wei-En, et al.
Published: (2025)
by: Tai, Wei-En, et al.
Published: (2025)
R2SM: Referring and Reasoning for Selective Masks
by: Shih, Yu-Lin, et al.
Published: (2025)
by: Shih, Yu-Lin, et al.
Published: (2025)
TPA3D: Triplane Attention for Fast Text-to-3D Generation
by: Wu, Bin-Shih, et al.
Published: (2023)
by: Wu, Bin-Shih, et al.
Published: (2023)
TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
by: Cheng, Wei-Yuan, et al.
Published: (2026)
by: Cheng, Wei-Yuan, et al.
Published: (2026)
PFGS: Pose-Fused 3D Gaussian Splatting for Complete Multi-Pose Object Reconstruction
by: Yen, Ting-Yu, et al.
Published: (2025)
by: Yen, Ting-Yu, et al.
Published: (2025)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
by: Chang, Kai-Po, et al.
Published: (2025)
by: Chang, Kai-Po, et al.
Published: (2025)
PromptHSI: Universal Hyperspectral Image Restoration with Vision-Language Modulated Frequency Adaptation
by: Lee, Chia-Ming, et al.
Published: (2024)
by: Lee, Chia-Ming, et al.
Published: (2024)
Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight Erasers
by: Huang, Chi-Pin, et al.
Published: (2023)
by: Huang, Chi-Pin, et al.
Published: (2023)
ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos
by: Chen, Jr-Jen, et al.
Published: (2024)
by: Chen, Jr-Jen, et al.
Published: (2024)
A$^2$TG: Adaptive Anisotropic Textured Gaussians for Efficient 3D Scene Representation
by: Hsu, Sheng-Chi, et al.
Published: (2026)
by: Hsu, Sheng-Chi, et al.
Published: (2026)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
by: Lin, Ci-Siang, et al.
Published: (2025)
by: Lin, Ci-Siang, et al.
Published: (2025)
Pixel Is Not a Barrier: An Effective Evasion Attack for Pixel-Domain Diffusion Models
by: Shih, Chun-Yen, et al.
Published: (2024)
by: Shih, Chun-Yen, et al.
Published: (2024)
Cross-Frequency Implicit Neural Representation with Self-Evolving Parameters
by: Yu, Chang, et al.
Published: (2025)
by: Yu, Chang, et al.
Published: (2025)
VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection
by: Qiu, Bo-Cheng, et al.
Published: (2026)
by: Qiu, Bo-Cheng, et al.
Published: (2026)
Parameter-Efficient Multi-Task Learning via Progressive Task-Specific Adaptation
by: Gangwar, Neeraj, et al.
Published: (2025)
by: Gangwar, Neeraj, et al.
Published: (2025)
Transformer-based Clipped Contrastive Quantization Learning for Unsupervised Image Retrieval
by: Dubey, Ayush, et al.
Published: (2024)
by: Dubey, Ayush, et al.
Published: (2024)
FrugalNeRF: Fast Convergence for Extreme Few-shot Novel View Synthesis without Learned Priors
by: Lin, Chin-Yang, et al.
Published: (2024)
by: Lin, Chin-Yang, et al.
Published: (2024)
LongSplat: Robust Unposed 3D Gaussian Splatting for Casual Long Videos
by: Lin, Chin-Yang, et al.
Published: (2025)
by: Lin, Chin-Yang, et al.
Published: (2025)
CANDLE: Illumination-Invariant Semantic Priors for Color Ambient Lighting Normalization
by: Jian, Rong-Lin, et al.
Published: (2026)
by: Jian, Rong-Lin, et al.
Published: (2026)
Generalized Jersey Number Recognition Using Multi-task Learning With Orientation-guided Weight Refinement
by: Lin, Yung-Hui, et al.
Published: (2024)
by: Lin, Yung-Hui, et al.
Published: (2024)
Two by Two: Learning Multi-Task Pairwise Objects Assembly for Generalizable Robot Manipulation
by: Qi, Yu, et al.
Published: (2025)
by: Qi, Yu, et al.
Published: (2025)
LoBE-GS: Load-Balanced and Efficient 3D Gaussian Splatting for Large-Scale Scene Reconstruction
by: Hung, Sheng-Hsiang, et al.
Published: (2025)
by: Hung, Sheng-Hsiang, et al.
Published: (2025)
EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction
by: Lin, Hsi-Che, et al.
Published: (2025)
by: Lin, Hsi-Che, et al.
Published: (2025)
Heuristic-Free Multi-Teacher Learning
by: Nguyen, Huy Thong, et al.
Published: (2024)
by: Nguyen, Huy Thong, et al.
Published: (2024)
3AM: 3egment Anything with Geometric Consistency in Videos
by: Sun, Yang-Che, et al.
Published: (2026)
by: Sun, Yang-Che, et al.
Published: (2026)
Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
by: Yang, Xiaoyu, et al.
Published: (2024)
by: Yang, Xiaoyu, et al.
Published: (2024)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
by: Huang, Chi-Pin, et al.
Published: (2025)
by: Huang, Chi-Pin, et al.
Published: (2025)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
by: Chen, Yi-Chia, et al.
Published: (2024)
by: Chen, Yi-Chia, et al.
Published: (2024)
ThreshNet: An Efficient DenseNet Using Threshold Mechanism to Reduce Connections
by: Ju, Rui-Yang, et al.
Published: (2022)
by: Ju, Rui-Yang, et al.
Published: (2022)
Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation
by: Chen, I-Hsiang, et al.
Published: (2025)
by: Chen, I-Hsiang, et al.
Published: (2025)
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking
by: Yu, Yanqiu, et al.
Published: (2026)
by: Yu, Yanqiu, et al.
Published: (2026)
Towards Affordance-Aware Articulation Synthesis for Rigged Objects
by: Yu, Yu-Chu, et al.
Published: (2025)
by: Yu, Yu-Chu, et al.
Published: (2025)
RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task
by: Li, Chunshan, et al.
Published: (2025)
by: Li, Chunshan, et al.
Published: (2025)
Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition
by: Yeh, Chun-Hsiao, et al.
Published: (2024)
by: Yeh, Chun-Hsiao, et al.
Published: (2024)
ASHiTA: Automatic Scene-grounded HIerarchical Task Analysis
by: Chang, Yun, et al.
Published: (2025)
by: Chang, Yun, et al.
Published: (2025)
Similar Items
-
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
by: Liu, Shih-Wen, et al.
Published: (2025) -
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
by: Huang, Chi-Pin, et al.
Published: (2025) -
Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval
by: Chu, Xuangeng, et al.
Published: (2026) -
Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models
by: Yu, Yu-Chu, et al.
Published: (2024) -
MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching
by: Wu, Yen-Siang, et al.
Published: (2025)