Ranking-aware adapter for text-driven image ordering with CLIP
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Wei-Hsiang, Lin, Yen-Yu, Yang, Ming-Hsuan, Tsai, Yi-Hsuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Gaga: Group Any Gaussians via 3D-aware Memory Bank
by: Lyu, Weijie, et al.
Published: (2024)
by: Lyu, Weijie, et al.
Published: (2024)
Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance
by: Huang, Kuan-Chih, et al.
Published: (2023)
by: Huang, Kuan-Chih, et al.
Published: (2023)
PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
by: Huang, Kuan-Chih, et al.
Published: (2023)
by: Huang, Kuan-Chih, et al.
Published: (2023)
Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
by: Lin, Yu-Hsuan
Published: (2025)
by: Lin, Yu-Hsuan
Published: (2025)
Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts
by: Fang, Shuangkang, et al.
Published: (2024)
by: Fang, Shuangkang, et al.
Published: (2024)
Efficiently Disentangling CLIP for Multi-Object Perception
by: Rawlekar, Samyak, et al.
Published: (2025)
by: Rawlekar, Samyak, et al.
Published: (2025)
Text-Driven Image Editing via Learnable Regions
by: Lin, Yuanze, et al.
Published: (2023)
by: Lin, Yuanze, et al.
Published: (2023)
Low-Rank Head Avatar Personalization with Registers
by: Chakkera, Sai Tanmay Reddy, et al.
Published: (2025)
by: Chakkera, Sai Tanmay Reddy, et al.
Published: (2025)
Self-training Room Layout Estimation via Geometry-aware Ray-casting
by: Solarte, Bolivar, et al.
Published: (2024)
by: Solarte, Bolivar, et al.
Published: (2024)
Exemplar Masking for Multimodal Incremental Learning
by: Lee, Yi-Lun, et al.
Published: (2024)
by: Lee, Yi-Lun, et al.
Published: (2024)
Toward Real-world BEV Perception: Depth Uncertainty Estimation via Gaussian Splatting
by: Lu, Shu-Wei, et al.
Published: (2025)
by: Lu, Shu-Wei, et al.
Published: (2025)
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation
by: Lin, Yuanze, et al.
Published: (2025)
by: Lin, Yuanze, et al.
Published: (2025)
Improving Point-based Crowd Counting and Localization Based on Auxiliary Point Guidance
by: Chen, I-Hsiang, et al.
Published: (2024)
by: Chen, I-Hsiang, et al.
Published: (2024)
Dual Associated Encoder for Face Restoration
by: Tsai, Yu-Ju, et al.
Published: (2023)
by: Tsai, Yu-Ju, et al.
Published: (2023)
LoBE-GS: Load-Balanced and Efficient 3D Gaussian Splatting for Large-Scale Scene Reconstruction
by: Hung, Sheng-Hsiang, et al.
Published: (2025)
by: Hung, Sheng-Hsiang, et al.
Published: (2025)
CLIP-DR: Textual Knowledge-Guided Diabetic Retinopathy Grading with Ranking-aware Prompting
by: Yu, Qinkai, et al.
Published: (2024)
by: Yu, Qinkai, et al.
Published: (2024)
Defending Text-to-image Diffusion Models: Surprising Efficacy of Textual Perturbations Against Backdoor Attacks
by: Chew, Oscar, et al.
Published: (2024)
by: Chew, Oscar, et al.
Published: (2024)
PHATNet: A Physics-guided Haze Transfer Network for Domain-adaptive Real-world Image Dehazing
by: Tsai, Fu-Jen, et al.
Published: (2025)
by: Tsai, Fu-Jen, et al.
Published: (2025)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
by: Lee, Yi-Lun, et al.
Published: (2024)
by: Lee, Yi-Lun, et al.
Published: (2024)
MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
by: Fang, Shuangkang, et al.
Published: (2025)
by: Fang, Shuangkang, et al.
Published: (2025)
Patch Ranking: Efficient CLIP by Learning to Rank Local Patches
by: Wu, Cheng-En, et al.
Published: (2024)
by: Wu, Cheng-En, et al.
Published: (2024)
Few-Shot Semantic Segmentation Meets SAM3
by: Tsai, Yi-Jen, et al.
Published: (2026)
by: Tsai, Yi-Jen, et al.
Published: (2026)
Quantum Information-Empowered Graph Neural Network for Hyperspectral Change Detection
by: Lin, Chia-Hsiang, et al.
Published: (2024)
by: Lin, Chia-Hsiang, et al.
Published: (2024)
Domain-adaptive Video Deblurring via Test-time Blurring
by: He, Jin-Ting, et al.
Published: (2024)
by: He, Jin-Ting, et al.
Published: (2024)
Effective Adapter for Face Recognition in the Wild
by: Liu, Yunhao, et al.
Published: (2023)
by: Liu, Yunhao, et al.
Published: (2023)
DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes
by: Liu, Jinxiu, et al.
Published: (2024)
by: Liu, Jinxiu, et al.
Published: (2024)
HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving
by: Xia, Zhongyu, et al.
Published: (2025)
by: Xia, Zhongyu, et al.
Published: (2025)
Tex4D: Zero-shot 4D Scene Texturing with Video Diffusion Models
by: Bao, Jingzhi, et al.
Published: (2024)
by: Bao, Jingzhi, et al.
Published: (2024)
Interactive Multi-Head Self-Attention with Linear Complexity
by: Kang, Hankyul, et al.
Published: (2024)
by: Kang, Hankyul, et al.
Published: (2024)
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning
by: Lyu, Weijie, et al.
Published: (2026)
by: Lyu, Weijie, et al.
Published: (2026)
Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding
by: Mei, Guofeng, et al.
Published: (2025)
by: Mei, Guofeng, et al.
Published: (2025)
Self-Attention with State-Object Weighted Combination for Compositional Zero Shot Learning
by: Chang, Cheng-Hong, et al.
Published: (2025)
by: Chang, Cheng-Hong, et al.
Published: (2025)
uLayout: Unified Room Layout Estimation for Perspective and Panoramic Images
by: Lee, Jonathan, et al.
Published: (2025)
by: Lee, Jonathan, et al.
Published: (2025)
CSAD: Unsupervised Component Segmentation for Logical Anomaly Detection
by: Hsieh, Yu-Hsuan, et al.
Published: (2024)
by: Hsieh, Yu-Hsuan, et al.
Published: (2024)
Dynamic Camera Poses and Where to Find Them
by: Rockwell, Chris, et al.
Published: (2025)
by: Rockwell, Chris, et al.
Published: (2025)
A$^2$TG: Adaptive Anisotropic Textured Gaussians for Efficient 3D Scene Representation
by: Hsu, Sheng-Chi, et al.
Published: (2026)
by: Hsu, Sheng-Chi, et al.
Published: (2026)
FaceLift: Learning Generalizable Single Image 3D Face Reconstruction from Synthetic Heads
by: Lyu, Weijie, et al.
Published: (2024)
by: Lyu, Weijie, et al.
Published: (2024)
PFGS: Pose-Fused 3D Gaussian Splatting for Complete Multi-Pose Object Reconstruction
by: Yen, Ting-Yu, et al.
Published: (2025)
by: Yen, Ting-Yu, et al.
Published: (2025)
Restage4D: Reanimating Deformable 3D Reconstruction from a Single Video
by: He, Jixuan, et al.
Published: (2025)
by: He, Jixuan, et al.
Published: (2025)
Action-slot: Visual Action-centric Representations for Multi-label Atomic Activity Recognition in Traffic Scenes
by: Kung, Chi-Hsi, et al.
Published: (2023)
by: Kung, Chi-Hsi, et al.
Published: (2023)
Similar Items
-
Gaga: Group Any Gaussians via 3D-aware Memory Bank
by: Lyu, Weijie, et al.
Published: (2024) -
Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance
by: Huang, Kuan-Chih, et al.
Published: (2023) -
PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
by: Huang, Kuan-Chih, et al.
Published: (2023) -
Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
by: Lin, Yu-Hsuan
Published: (2025) -
Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts
by: Fang, Shuangkang, et al.
Published: (2024)