Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Harold Haodong, Yang, Harry, Lim, Ser-Nam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Temporal Regularization Makes Your Video Generator Stronger
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
AirSketch: Generative Motion to Sketch
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024)
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)
Jack of All Tasks, Master of Many: Designing General-purpose Coarse-to-Fine Vision-Language Model
di: Pramanick, Shraman, et al.
Pubblicazione: (2023)
di: Pramanick, Shraman, et al.
Pubblicazione: (2023)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
VideoMerge: Towards Training-free Long Video Generation
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
di: Zhang, Siyang, et al.
Pubblicazione: (2025)
DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Visual Agentic Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2024)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
di: Ku, Max, et al.
Pubblicazione: (2024)
di: Ku, Max, et al.
Pubblicazione: (2024)
Memory-Efficient Fine-Tuning for Quantized Diffusion Model
di: Ryu, Hyogon, et al.
Pubblicazione: (2024)
di: Ryu, Hyogon, et al.
Pubblicazione: (2024)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance
di: Shao, Dian, et al.
Pubblicazione: (2025)
di: Shao, Dian, et al.
Pubblicazione: (2025)
Unlocking the Potential of Unlabeled Data in Semi-Supervised Domain Generalization
di: Lee, Dongkwan, et al.
Pubblicazione: (2025)
di: Lee, Dongkwan, et al.
Pubblicazione: (2025)
Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
di: Zou, Shu, et al.
Pubblicazione: (2025)
di: Zou, Shu, et al.
Pubblicazione: (2025)
Beyond Voxel 3D Editing: Learning from 3D Masks and Self-Constructed Data
di: Xu, Yizhao, et al.
Pubblicazione: (2026)
di: Xu, Yizhao, et al.
Pubblicazione: (2026)
ESCA: Contextualizing Embodied Agents via Scene-Graph Generation
di: Huang, Jiani, et al.
Pubblicazione: (2025)
di: Huang, Jiani, et al.
Pubblicazione: (2025)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
di: Cai, Xinyan, et al.
Pubblicazione: (2025)
di: Cai, Xinyan, et al.
Pubblicazione: (2025)
Towards Chunk-Wise Generation for Long Videos
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
di: Zhang, Siyang, et al.
Pubblicazione: (2024)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
di: Oh, Changdae, et al.
Pubblicazione: (2023)
di: Oh, Changdae, et al.
Pubblicazione: (2023)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
Clustering via Self-Supervised Diffusion
di: Uziel, Roy, et al.
Pubblicazione: (2025)
di: Uziel, Roy, et al.
Pubblicazione: (2025)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
di: Park, Dongmin, et al.
Pubblicazione: (2024)
di: Park, Dongmin, et al.
Pubblicazione: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation
di: Yang, Guangjing, et al.
Pubblicazione: (2026)
di: Yang, Guangjing, et al.
Pubblicazione: (2026)
Efficient Adversarial Training via Criticality-Aware Fine-Tuning
di: Li, Wenyun, et al.
Pubblicazione: (2026)
di: Li, Wenyun, et al.
Pubblicazione: (2026)
Enhancing Self-Supervised Fine-Grained Video Object Tracking with Dynamic Memory Prediction
di: Zhou, Zihan, et al.
Pubblicazione: (2025)
di: Zhou, Zihan, et al.
Pubblicazione: (2025)
The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment
di: Liu, Hongyuan, et al.
Pubblicazione: (2026)
di: Liu, Hongyuan, et al.
Pubblicazione: (2026)
Beyond CNNs: Efficient Fine-Tuning of Multi-Modal LLMs for Object Detection on Low-Data Regimes
di: Elamon, Nirmal, et al.
Pubblicazione: (2025)
di: Elamon, Nirmal, et al.
Pubblicazione: (2025)
S$^3$POT: Contrast-Driven Face Occlusion Segmentation via Self-Supervised Prompt Learning
di: Wang, Lingsong, et al.
Pubblicazione: (2026)
di: Wang, Lingsong, et al.
Pubblicazione: (2026)
UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision
di: Han, Ruiyan, et al.
Pubblicazione: (2026)
di: Han, Ruiyan, et al.
Pubblicazione: (2026)
L2P: Unlocking Latent Potential for Pixel Generation
di: Chen, Zhennan, et al.
Pubblicazione: (2026)
di: Chen, Zhennan, et al.
Pubblicazione: (2026)
OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
di: Huang, Runhui, et al.
Pubblicazione: (2026)
di: Huang, Runhui, et al.
Pubblicazione: (2026)
Label-Efficient School Detection from Aerial Imagery via Weakly Supervised Pretraining and Fine-Tuning
di: Elmimouni, Zakarya, et al.
Pubblicazione: (2026)
di: Elmimouni, Zakarya, et al.
Pubblicazione: (2026)
Boost Self-Supervised Dataset Distillation via Parameterization, Predefined Augmentation, and Approximation
di: Yu, Sheng-Feng, et al.
Pubblicazione: (2025)
di: Yu, Sheng-Feng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025) -
Temporal Regularization Makes Your Video Generator Stronger
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025) -
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
di: Wang, Yifan, et al.
Pubblicazione: (2025) -
AirSketch: Generative Motion to Sketch
di: Lim, Hui Xian Grace, et al.
Pubblicazione: (2024) -
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
di: Meyarian, Abolfazl, et al.
Pubblicazione: (2026)