GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Shijie, Ge, Yuying, Wang, Teng, Guo, Yuxin, Ge, Yixiao, Shan, Ying |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
por: Guo, Yuxin, et al.
Publicado: (2025)
por: Guo, Yuxin, et al.
Publicado: (2025)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
por: Li, Yizhuo, et al.
Publicado: (2024)
por: Li, Yizhuo, et al.
Publicado: (2024)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
por: Pu, Junfu, et al.
Publicado: (2025)
por: Pu, Junfu, et al.
Publicado: (2025)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
por: Qiu, Lu, et al.
Publicado: (2025)
por: Qiu, Lu, et al.
Publicado: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
por: Li, Bohao, et al.
Publicado: (2024)
por: Li, Bohao, et al.
Publicado: (2024)
Aligning Latent Spaces with Flow Priors
por: Li, Yizhuo, et al.
Publicado: (2025)
por: Li, Yizhuo, et al.
Publicado: (2025)
Supervised Fine-tuning in turn Improves Visual Foundation Models
por: Jiang, Xiaohu, et al.
Publicado: (2024)
por: Jiang, Xiaohu, et al.
Publicado: (2024)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
por: Qiu, Lu, et al.
Publicado: (2024)
por: Qiu, Lu, et al.
Publicado: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
por: Lin, Haokun, et al.
Publicado: (2025)
por: Lin, Haokun, et al.
Publicado: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
por: Zhou, Shengchao, et al.
Publicado: (2025)
por: Zhou, Shengchao, et al.
Publicado: (2025)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
por: Cheng, Cheng, et al.
Publicado: (2023)
por: Cheng, Cheng, et al.
Publicado: (2023)
ST-LLM: Large Language Models Are Effective Temporal Learners
por: Liu, Ruyang, et al.
Publicado: (2024)
por: Liu, Ruyang, et al.
Publicado: (2024)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
por: Chen, Yi, et al.
Publicado: (2023)
por: Chen, Yi, et al.
Publicado: (2023)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
por: Chen, Yi, et al.
Publicado: (2025)
por: Chen, Yi, et al.
Publicado: (2025)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
por: Chen, Yi, et al.
Publicado: (2025)
por: Chen, Yi, et al.
Publicado: (2025)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
por: Liu, Ruyang, et al.
Publicado: (2023)
por: Liu, Ruyang, et al.
Publicado: (2023)
ViT-Lens: Towards Omni-modal Representations
por: Lei, Weixian, et al.
Publicado: (2023)
por: Lei, Weixian, et al.
Publicado: (2023)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
YOLO-World: Real-Time Open-Vocabulary Object Detection
por: Cheng, Tianheng, et al.
Publicado: (2024)
por: Cheng, Tianheng, et al.
Publicado: (2024)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
por: Chen, Yi, et al.
Publicado: (2026)
por: Chen, Yi, et al.
Publicado: (2026)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
por: Pu, Junfu, et al.
Publicado: (2026)
por: Pu, Junfu, et al.
Publicado: (2026)
VoCo-LLaMA: Towards Vision Compression with Large Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
por: Chen, Yi, et al.
Publicado: (2024)
por: Chen, Yi, et al.
Publicado: (2024)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation Models
por: Guo, Jianyuan, et al.
Publicado: (2024)
por: Guo, Jianyuan, et al.
Publicado: (2024)
ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
por: Ge, Yuying, et al.
Publicado: (2025)
por: Ge, Yuying, et al.
Publicado: (2025)
Scalable Image Tokenization with Index Backpropagation Quantization
por: Shi, Fengyuan, et al.
Publicado: (2024)
por: Shi, Fengyuan, et al.
Publicado: (2024)
IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models
por: Chen, Zhihao, et al.
Publicado: (2023)
por: Chen, Zhihao, et al.
Publicado: (2023)
Beyond Visual Cues: Synchronously Exploring Target-Centric Semantics for Vision-Language Tracking
por: Ge, Jiawei, et al.
Publicado: (2023)
por: Ge, Jiawei, et al.
Publicado: (2023)
ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights
por: Lei, Weixian, et al.
Publicado: (2023)
por: Lei, Weixian, et al.
Publicado: (2023)
GrootVL: Tree Topology is All You Need in State Space Model
por: Xiao, Yicheng, et al.
Publicado: (2024)
por: Xiao, Yicheng, et al.
Publicado: (2024)
GenCompositor: Generative Video Compositing with Diffusion Transformer
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
Ejemplares similares
-
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
por: Guo, Yuxin, et al.
Publicado: (2025) -
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024) -
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
por: Li, Yizhuo, et al.
Publicado: (2024) -
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
por: Pu, Junfu, et al.
Publicado: (2025) -
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
por: Cheng, Junhao, et al.
Publicado: (2025)