Fine-Tuning Visual Autoregressive Models for Subject-Driven Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Chung, Jiwoo, Hyun, Sangeek, Kim, Hyunjun, Koh, Eunseo, Lee, MinKyu, Heo, Jae-Pil |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization
por: Lee, MinKyu, et al.
Publicado: (2025)
por: Lee, MinKyu, et al.
Publicado: (2025)
Cross-scale Aligned Supervision for Training GANs
por: Hyun, Sangeek, et al.
Publicado: (2026)
por: Hyun, Sangeek, et al.
Publicado: (2026)
Scalable GANs with Transformers
por: Hyun, Sangeek, et al.
Publicado: (2025)
por: Hyun, Sangeek, et al.
Publicado: (2025)
Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style Transfer
por: Chung, Jiwoo, et al.
Publicado: (2023)
por: Chung, Jiwoo, et al.
Publicado: (2023)
Auto-Encoded Supervision for Perceptual Image Super-Resolution
por: Lee, MinKyu, et al.
Publicado: (2024)
por: Lee, MinKyu, et al.
Publicado: (2024)
SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models
por: Chung, Jiwoo, et al.
Publicado: (2026)
por: Chung, Jiwoo, et al.
Publicado: (2026)
Noise-free Optimization in Early Training Steps for Image Super-Resolution
por: Lee, MinKyu, et al.
Publicado: (2023)
por: Lee, MinKyu, et al.
Publicado: (2023)
GSGAN: Adversarial Learning for Hierarchical Generation of 3D Gaussian Splats
por: Hyun, Sangeek, et al.
Publicado: (2024)
por: Hyun, Sangeek, et al.
Publicado: (2024)
Diversity-aware Channel Pruning for StyleGAN Compression
por: Chung, Jiwoo, et al.
Publicado: (2024)
por: Chung, Jiwoo, et al.
Publicado: (2024)
Disambiguating 2D-3D Correspondences in Gaussian Splatting-based Feature Fields for Visual Localization
por: Lee, Miso, et al.
Publicado: (2026)
por: Lee, Miso, et al.
Publicado: (2026)
Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding
por: Moon, WonJun, et al.
Publicado: (2023)
por: Moon, WonJun, et al.
Publicado: (2023)
Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models
por: Koh, Eunseo, et al.
Publicado: (2025)
por: Koh, Eunseo, et al.
Publicado: (2025)
PDF-GS: Progressive Distractor Filtering for Robust 3D Gaussian Splatting
por: Seo, Kangmin, et al.
Publicado: (2026)
por: Seo, Kangmin, et al.
Publicado: (2026)
Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation
por: Lee, ByeongCheol, et al.
Publicado: (2026)
por: Lee, ByeongCheol, et al.
Publicado: (2026)
Activating Self-Attention for Multi-Scene Absolute Pose Regression
por: Lee, Miso, et al.
Publicado: (2024)
por: Lee, Miso, et al.
Publicado: (2024)
Long-term Pre-training for Temporal Action Detection with Transformers
por: Kim, Jihwan, et al.
Publicado: (2024)
por: Kim, Jihwan, et al.
Publicado: (2024)
VLCounter: Text-aware Visual Representation for Zero-Shot Object Counting
por: Kang, Seunggu, et al.
Publicado: (2023)
por: Kang, Seunggu, et al.
Publicado: (2023)
Foreground-Covering Prototype Generation and Matching for SAM-Aided Few-Shot Segmentation
por: Park, Suho, et al.
Publicado: (2025)
por: Park, Suho, et al.
Publicado: (2025)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
por: Wu, Yi, et al.
Publicado: (2025)
por: Wu, Yi, et al.
Publicado: (2025)
Mutually-Aware Feature Learning for Few-Shot Object Counting
por: Jeon, Yerim, et al.
Publicado: (2024)
por: Jeon, Yerim, et al.
Publicado: (2024)
From Vicious to Virtuous Cycles: Synergistic Representation Learning for Unsupervised Video Object-Centric Learning
por: Seong, Hyun Seok, et al.
Publicado: (2026)
por: Seong, Hyun Seok, et al.
Publicado: (2026)
Selective Contrastive Learning for Weakly Supervised Affordance Grounding
por: Moon, WonJun, et al.
Publicado: (2025)
por: Moon, WonJun, et al.
Publicado: (2025)
Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learning
por: Moon, WonJun, et al.
Publicado: (2026)
por: Moon, WonJun, et al.
Publicado: (2026)
Progressive Proxy Anchor Propagation for Unsupervised Semantic Segmentation
por: Seong, Hyun Seok, et al.
Publicado: (2024)
por: Seong, Hyun Seok, et al.
Publicado: (2024)
Boundary-Recovering Network for Temporal Action Detection
por: Kim, Jihwan, et al.
Publicado: (2024)
por: Kim, Jihwan, et al.
Publicado: (2024)
Prediction-Feedback DETR for Temporal Action Detection
por: Kim, Jihwan, et al.
Publicado: (2024)
por: Kim, Jihwan, et al.
Publicado: (2024)
White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation
por: Im, Jiyun, et al.
Publicado: (2025)
por: Im, Jiyun, et al.
Publicado: (2025)
Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model
por: Lee, SuBeen, et al.
Publicado: (2025)
por: Lee, SuBeen, et al.
Publicado: (2025)
Temporal Alignment-Free Video Matching for Few-shot Action Recognition
por: Lee, SuBeen, et al.
Publicado: (2025)
por: Lee, SuBeen, et al.
Publicado: (2025)
DreamVAR: Taming Reinforced Visual Autoregressive Model for High-Fidelity Subject-Driven Image Generation
por: Jiang, Xin, et al.
Publicado: (2026)
por: Jiang, Xin, et al.
Publicado: (2026)
Temporally Consistent Long-Term Memory for 3D Single Object Tracking
por: Yoo, Jaejoon, et al.
Publicado: (2026)
por: Yoo, Jaejoon, et al.
Publicado: (2026)
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
por: Jeon, Yerim, et al.
Publicado: (2025)
por: Jeon, Yerim, et al.
Publicado: (2025)
Mitigating Background Shift in Class-Incremental Semantic Segmentation
por: Park, Gilhan, et al.
Publicado: (2024)
por: Park, Gilhan, et al.
Publicado: (2024)
Lipsum-FT: Robust Fine-Tuning of Zero-Shot Models Using Random Text Guidance
por: Nam, Giung, et al.
Publicado: (2024)
por: Nam, Giung, et al.
Publicado: (2024)
Practical Fine-Tuning of Autoregressive Models on Limited Handwritten Texts
por: Kohút, Jan, et al.
Publicado: (2025)
por: Kohút, Jan, et al.
Publicado: (2025)
Autoregressive Universal Video Segmentation Model
por: Heo, Miran, et al.
Publicado: (2025)
por: Heo, Miran, et al.
Publicado: (2025)
CAT: Contrastive Adapter Training for Personalized Image Generation
por: Park, Jae Wan, et al.
Publicado: (2024)
por: Park, Jae Wan, et al.
Publicado: (2024)
QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning
por: Chen, Jiun-Man, et al.
Publicado: (2024)
por: Chen, Jiun-Man, et al.
Publicado: (2024)
ZIUM: Zero-Shot Intent-Aware Adversarial Attack on Unlearned Models
por: Yook, Hyun Jun, et al.
Publicado: (2025)
por: Yook, Hyun Jun, et al.
Publicado: (2025)
Fine-Tuning Next-Scale Visual Autoregressive Models with Group Relative Policy Optimization
por: Gallici, Matteo, et al.
Publicado: (2025)
por: Gallici, Matteo, et al.
Publicado: (2025)
Ejemplares similares
-
Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization
por: Lee, MinKyu, et al.
Publicado: (2025) -
Cross-scale Aligned Supervision for Training GANs
por: Hyun, Sangeek, et al.
Publicado: (2026) -
Scalable GANs with Transformers
por: Hyun, Sangeek, et al.
Publicado: (2025) -
Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style Transfer
por: Chung, Jiwoo, et al.
Publicado: (2023) -
Auto-Encoded Supervision for Perceptual Image Super-Resolution
por: Lee, MinKyu, et al.
Publicado: (2024)