See Further When Clear: Curriculum Consistency Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yunpeng, Liu, Boxiao, Zhang, Yi, Hou, Xingzhong, Song, Guanglu, Liu, Yu, You, Haihang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Seamless Borders: A Method for Mitigating Inconsistencies in Image Inpainting and Outpainting
por: Hou, Xingzhong, et al.
Publicado: (2025)
por: Hou, Xingzhong, et al.
Publicado: (2025)
Brain-Inspired Efficient Pruning: Exploiting Criticality in Spiking Neural Networks
por: Chen, Shuo, et al.
Publicado: (2023)
por: Chen, Shuo, et al.
Publicado: (2023)
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
por: Xue, Zeyue, et al.
Publicado: (2023)
por: Xue, Zeyue, et al.
Publicado: (2023)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
por: Liu, Yi, et al.
Publicado: (2026)
por: Liu, Yi, et al.
Publicado: (2026)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
por: Liu, Yexin, et al.
Publicado: (2024)
por: Liu, Yexin, et al.
Publicado: (2024)
Enhancing Vision-Language Model with Unmasked Token Alignment
por: Liu, Jihao, et al.
Publicado: (2024)
por: Liu, Jihao, et al.
Publicado: (2024)
SeeClear: Semantic Distillation Enhances Pixel Condensation for Video Super-Resolution
por: Tang, Qi, et al.
Publicado: (2024)
por: Tang, Qi, et al.
Publicado: (2024)
Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
por: Ma, Bingqi, et al.
Publicado: (2024)
por: Ma, Bingqi, et al.
Publicado: (2024)
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
por: Hu, Xin, et al.
Publicado: (2026)
por: Hu, Xin, et al.
Publicado: (2026)
Seeing Further on the Shoulders of Giants: Knowledge Inheritance for Vision Foundation Models
por: Huang, Jiabo, et al.
Publicado: (2025)
por: Huang, Jiabo, et al.
Publicado: (2025)
Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
por: Ge, Xingtong, et al.
Publicado: (2026)
por: Ge, Xingtong, et al.
Publicado: (2026)
FouriScale: A Frequency Perspective on Training-Free High-Resolution Image Synthesis
por: Huang, Linjiang, et al.
Publicado: (2024)
por: Huang, Linjiang, et al.
Publicado: (2024)
Phased Consistency Models
por: Wang, Fu-Yun, et al.
Publicado: (2024)
por: Wang, Fu-Yun, et al.
Publicado: (2024)
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
por: Ma, Bingqi, et al.
Publicado: (2026)
por: Ma, Bingqi, et al.
Publicado: (2026)
Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation
por: Chang, Chun-Peng, et al.
Publicado: (2025)
por: Chang, Chun-Peng, et al.
Publicado: (2025)
Pixelis: Reasoning in Pixels, from Seeing to Acting
por: Zhou, Yunpeng
Publicado: (2026)
por: Zhou, Yunpeng
Publicado: (2026)
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
por: Wu, Zhiheng, et al.
Publicado: (2026)
por: Wu, Zhiheng, et al.
Publicado: (2026)
Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding
por: Tang, Feilong, et al.
Publicado: (2025)
por: Tang, Feilong, et al.
Publicado: (2025)
Learning to See in the Extremely Dark
por: Jiang, Hai, et al.
Publicado: (2025)
por: Jiang, Hai, et al.
Publicado: (2025)
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
por: He, Dailan, et al.
Publicado: (2026)
por: He, Dailan, et al.
Publicado: (2026)
Seeing Cells Clearly: Evaluating Machine Vision Strategies for Microglia Centroid Detection in 3D Images
por: Zhang, Youjia
Publicado: (2025)
por: Zhang, Youjia
Publicado: (2025)
ADT: Tuning Diffusion Models with Adversarial Supervision
por: Shen, Dazhong, et al.
Publicado: (2025)
por: Shen, Dazhong, et al.
Publicado: (2025)
Semantics and Content Matter: Towards Multi-Prior Hierarchical Mamba for Image Deraining
por: Yu, Zhaocheng, et al.
Publicado: (2025)
por: Yu, Zhaocheng, et al.
Publicado: (2025)
SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification
por: Wang, Xiaoying, et al.
Publicado: (2026)
por: Wang, Xiaoying, et al.
Publicado: (2026)
Acc3D: Accelerating Single Image to 3D Diffusion Models via Edge Consistency Guided Score Distillation
por: Liu, Kendong, et al.
Publicado: (2025)
por: Liu, Kendong, et al.
Publicado: (2025)
Supervise Less, See More: Training-free Nuclear Instance Segmentation with Prototype-Guided Prompting
por: Zhang, Wen, et al.
Publicado: (2025)
por: Zhang, Wen, et al.
Publicado: (2025)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
por: Li, Kunchang, et al.
Publicado: (2022)
por: Li, Kunchang, et al.
Publicado: (2022)
EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM
por: Zong, Zhuofan, et al.
Publicado: (2024)
por: Zong, Zhuofan, et al.
Publicado: (2024)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
por: Shao, Hao, et al.
Publicado: (2024)
por: Shao, Hao, et al.
Publicado: (2024)
4DSTR: Advancing Generative 4D Gaussians with Spatial-Temporal Rectification for High-Quality and Consistent 4D Generation
por: Liu, Mengmeng, et al.
Publicado: (2025)
por: Liu, Mengmeng, et al.
Publicado: (2025)
Channel Consistency Prior and Self-Reconstruction Strategy Based Unsupervised Image Deraining
por: Dong, Guanglu, et al.
Publicado: (2025)
por: Dong, Guanglu, et al.
Publicado: (2025)
Stable-Makeup: When Real-World Makeup Transfer Meets Diffusion Model
por: Zhang, Yuxuan, et al.
Publicado: (2024)
por: Zhang, Yuxuan, et al.
Publicado: (2024)
Adaptive Whole-Body PET Image Denoising Using 3D Diffusion Models with ControlNet
por: Yu, Boxiao, et al.
Publicado: (2024)
por: Yu, Boxiao, et al.
Publicado: (2024)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
por: Hou, Wenjin, et al.
Publicado: (2026)
por: Hou, Wenjin, et al.
Publicado: (2026)
Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance
por: Shen, Dazhong, et al.
Publicado: (2024)
por: Shen, Dazhong, et al.
Publicado: (2024)
LookOut: Real-World Humanoid Egocentric Navigation
por: Pan, Boxiao, et al.
Publicado: (2025)
por: Pan, Boxiao, et al.
Publicado: (2025)
Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
por: Song, Yiren, et al.
Publicado: (2025)
por: Song, Yiren, et al.
Publicado: (2025)
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
por: Yang, Siqi, et al.
Publicado: (2025)
por: Yang, Siqi, et al.
Publicado: (2025)
Seeing Motion at Nighttime with an Event Camera
por: Liu, Haoyue, et al.
Publicado: (2024)
por: Liu, Haoyue, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Seamless Borders: A Method for Mitigating Inconsistencies in Image Inpainting and Outpainting
por: Hou, Xingzhong, et al.
Publicado: (2025) -
Brain-Inspired Efficient Pruning: Exploiting Criticality in Spiking Neural Networks
por: Chen, Shuo, et al.
Publicado: (2023) -
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
por: Xue, Zeyue, et al.
Publicado: (2023) -
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
por: Liu, Yi, et al.
Publicado: (2026) -
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
por: Liu, Yexin, et al.
Publicado: (2024)