Guardado en:
| Autores principales: | Yun, Guhnoo, Yoo, Juhan, Kim, Kijung, Lee, Jeongho, Seo, Paul Hongsuck, Kim, Dong Hwan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2503.23947 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Initiation of Interaction Detection Framework using a Nonverbal Cue for Human-Robot Interaction
por: Yun, Guhnoo, et al.
Publicado: (2026)
por: Yun, Guhnoo, et al.
Publicado: (2026)
Robust Image Self-Recovery against Tampering using Watermark Generation with Pixel Shuffling
por: Kim, Minyoung, et al.
Publicado: (2025)
por: Kim, Minyoung, et al.
Publicado: (2025)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
Image Diffusion Models Exhibit Emergent Temporal Propagation in Videos
por: Kim, Youngseo, et al.
Publicado: (2025)
por: Kim, Youngseo, et al.
Publicado: (2025)
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
por: Kim, Dohyun, et al.
Publicado: (2025)
por: Kim, Dohyun, et al.
Publicado: (2025)
Learning Correlation Structures for Vision Transformers
por: Kim, Manjin, et al.
Publicado: (2024)
por: Kim, Manjin, et al.
Publicado: (2024)
Multi-Granularity Video Object Segmentation
por: Lim, Sangbeom, et al.
Publicado: (2024)
por: Lim, Sangbeom, et al.
Publicado: (2024)
Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
por: Lee, Seung-jae, et al.
Publicado: (2025)
por: Lee, Seung-jae, et al.
Publicado: (2025)
Bridging the Domain Gap: A Simple Domain Matching Method for Reference-based Image Super-Resolution in Remote Sensing
por: Min, Jeongho, et al.
Publicado: (2024)
por: Min, Jeongho, et al.
Publicado: (2024)
Towards Open-Vocabulary Semantic Segmentation Without Semantic Labels
por: Shin, Heeseong, et al.
Publicado: (2024)
por: Shin, Heeseong, et al.
Publicado: (2024)
CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation
por: Cho, Seokju, et al.
Publicado: (2023)
por: Cho, Seokju, et al.
Publicado: (2023)
TranSplat: Surface Embedding-guided 3D Gaussian Splatting for Transparent Object Manipulation
por: Kim, Jeongyun, et al.
Publicado: (2025)
por: Kim, Jeongyun, et al.
Publicado: (2025)
Pseudo-RIS: Distinctive Pseudo-supervision Generation for Referring Image Segmentation
por: Yu, Seonghoon, et al.
Publicado: (2024)
por: Yu, Seonghoon, et al.
Publicado: (2024)
Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy
por: Kim, Juyeon, et al.
Publicado: (2025)
por: Kim, Juyeon, et al.
Publicado: (2025)
Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
por: Kim, Chaehyun, et al.
Publicado: (2025)
por: Kim, Chaehyun, et al.
Publicado: (2025)
From Street to Orbit: Training-Free Cross-View Retrieval via Location Semantics and LLM Guidance
por: Min, Jeongho, et al.
Publicado: (2025)
por: Min, Jeongho, et al.
Publicado: (2025)
DialNav: Multi-turn Dialog Navigation with a Remote Guide
por: Han, Leekyeung, et al.
Publicado: (2025)
por: Han, Leekyeung, et al.
Publicado: (2025)
TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion Models
por: Kim, Jeongho, et al.
Publicado: (2024)
por: Kim, Jeongho, et al.
Publicado: (2024)
Clutt3R-Seg: Sparse-view 3D Instance Segmentation for Language-grounded Grasping in Cluttered Scenes
por: Noh, Jeongho, et al.
Publicado: (2026)
por: Noh, Jeongho, et al.
Publicado: (2026)
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
por: Ju, Jeongho, et al.
Publicado: (2024)
por: Ju, Jeongho, et al.
Publicado: (2024)
From Wardrobe to Canvas: Wardrobe Polyptych LoRA for Part-level Controllable Human Image Generation
por: Kim, Jeongho, et al.
Publicado: (2025)
por: Kim, Jeongho, et al.
Publicado: (2025)
Memory-Efficient Personalization of Text-to-Image Diffusion Models via Selective Optimization Strategies
por: Choi, Seokeon, et al.
Publicado: (2025)
por: Choi, Seokeon, et al.
Publicado: (2025)
BF-STVSR: B-Splines and Fourier-Best Friends for High Fidelity Spatial-Temporal Video Super-Resolution
por: Kim, Eunjin, et al.
Publicado: (2025)
por: Kim, Eunjin, et al.
Publicado: (2025)
H2G: Hierarchy-Aware Hyperbolic Grouping for 3D Scenes
por: Ko, ByungHa, et al.
Publicado: (2026)
por: Ko, ByungHa, et al.
Publicado: (2026)
What to Preserve and What to Transfer: Faithful, Identity-Preserving Diffusion-based Hairstyle Transfer
por: Chung, Chaeyeon, et al.
Publicado: (2024)
por: Chung, Chaeyeon, et al.
Publicado: (2024)
Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble
por: Cha, Juhan, et al.
Publicado: (2024)
por: Cha, Juhan, et al.
Publicado: (2024)
Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation
por: Kim, Min-Jung, et al.
Publicado: (2025)
por: Kim, Min-Jung, et al.
Publicado: (2025)
RePaintGS: Reference-Guided Gaussian Splatting for Realistic and View-Consistent 3D Scene Inpainting
por: Seo, Ji Hyun, et al.
Publicado: (2025)
por: Seo, Ji Hyun, et al.
Publicado: (2025)
TERDNet: Transformer Encoder-Recurrent Decoder Network for Scene Change Detection
por: Yoon, Jiae, et al.
Publicado: (2026)
por: Yoon, Jiae, et al.
Publicado: (2026)
Fieldscale: Locality-Aware Field-based Adaptive Rescaling for Thermal Infrared Image
por: Gil, Hyeonjae, et al.
Publicado: (2024)
por: Gil, Hyeonjae, et al.
Publicado: (2024)
JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts
por: Son, Taein, et al.
Publicado: (2024)
por: Son, Taein, et al.
Publicado: (2024)
UniSpector: Towards Universal Open-set Defect Recognition via Spectral-Contrastive Visual Prompting
por: Kim, Geonuk, et al.
Publicado: (2026)
por: Kim, Geonuk, et al.
Publicado: (2026)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
PlugTrack: Multi-Perceptive Motion Analysis for Adaptive Fusion in Multi-Object Tracking
por: Kim, Seungjae, et al.
Publicado: (2025)
por: Kim, Seungjae, et al.
Publicado: (2025)
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
por: Lew, Jaihyun, et al.
Publicado: (2024)
por: Lew, Jaihyun, et al.
Publicado: (2024)
Degradation-Agnostic Statistical Facial Feature Transformation for Blind Face Restoration in Adverse Weather Conditions
por: Son, Chang-Hwan, et al.
Publicado: (2025)
por: Son, Chang-Hwan, et al.
Publicado: (2025)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
por: Lee, Yuna, et al.
Publicado: (2026)
por: Lee, Yuna, et al.
Publicado: (2026)
PromptDresser: Improving the Quality and Controllability of Virtual Try-On via Generative Textual Prompt and Prompt-aware Mask
por: Kim, Jeongho, et al.
Publicado: (2024)
por: Kim, Jeongho, et al.
Publicado: (2024)
Masked Autoregressive Model for Weather Forecasting
por: Kim, Doyi, et al.
Publicado: (2024)
por: Kim, Doyi, et al.
Publicado: (2024)
A Decoding Scheme with Successive Aggregation of Multi-Level Features for Light-Weight Semantic Segmentation
por: Yoo, Jiwon, et al.
Publicado: (2024)
por: Yoo, Jiwon, et al.
Publicado: (2024)
Ejemplares similares
-
Initiation of Interaction Detection Framework using a Nonverbal Cue for Human-Robot Interaction
por: Yun, Guhnoo, et al.
Publicado: (2026) -
Robust Image Self-Recovery against Tampering using Watermark Generation with Pixel Shuffling
por: Kim, Minyoung, et al.
Publicado: (2025) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025) -
Image Diffusion Models Exhibit Emergent Temporal Propagation in Videos
por: Kim, Youngseo, et al.
Publicado: (2025) -
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
por: Kim, Dohyun, et al.
Publicado: (2025)