LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Zengqun, Liu, Ziquan, Cao, Yu, Gong, Shaogang, Zhang, Zhensong, Song, Jifei, Deng, Jiankang, Patras, Ioannis |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation
por: Zhao, Zengqun, et al.
Publicado: (2026)
por: Zhao, Zengqun, et al.
Publicado: (2026)
AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data
por: Zhao, Zengqun, et al.
Publicado: (2025)
por: Zhao, Zengqun, et al.
Publicado: (2025)
Temporal Score Analysis for Understanding and Correcting Diffusion Artifacts
por: Cao, Yu, et al.
Publicado: (2025)
por: Cao, Yu, et al.
Publicado: (2025)
Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer
por: Zhao, Zengqun, et al.
Publicado: (2024)
por: Zhao, Zengqun, et al.
Publicado: (2024)
Prompting Visual-Language Models for Dynamic Facial Expression Recognition
por: Zhao, Zengqun, et al.
Publicado: (2023)
por: Zhao, Zengqun, et al.
Publicado: (2023)
Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features
por: Gao, Zheng, et al.
Publicado: (2026)
por: Gao, Zheng, et al.
Publicado: (2026)
GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models
por: Zhang, Zhaohan, et al.
Publicado: (2025)
por: Zhang, Zhaohan, et al.
Publicado: (2025)
Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing
por: Cai, Weitong, et al.
Publicado: (2026)
por: Cai, Weitong, et al.
Publicado: (2026)
Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
Get Confused Cautiously: Textual Sequence Memorization Erasure with Selective Entropy Maximization
por: Zhang, Zhaohan, et al.
Publicado: (2024)
por: Zhang, Zhaohan, et al.
Publicado: (2024)
Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching
por: Miles, Roy, et al.
Publicado: (2026)
por: Miles, Roy, et al.
Publicado: (2026)
Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search
por: Oshima, Yuta, et al.
Publicado: (2025)
por: Oshima, Yuta, et al.
Publicado: (2025)
FashionSD-X: Multimodal Fashion Garment Synthesis using Latent Diffusion
por: Singh, Abhishek Kumar, et al.
Publicado: (2024)
por: Singh, Abhishek Kumar, et al.
Publicado: (2024)
Inference Time Alignment with Reward-Guided Tree Search
por: Hung, Chia-Yu, et al.
Publicado: (2024)
por: Hung, Chia-Yu, et al.
Publicado: (2024)
FG-Portrait: 3D Flow Guided Editable Portrait Animation
por: Xu, Yating, et al.
Publicado: (2026)
por: Xu, Yating, et al.
Publicado: (2026)
LatRef-Diff: Latent and Reference-Guided Diffusion for Facial Attribute Editing and Style Manipulation
por: Huang, Wenmin, et al.
Publicado: (2026)
por: Huang, Wenmin, et al.
Publicado: (2026)
Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
por: Cao, Yu, et al.
Publicado: (2024)
por: Cao, Yu, et al.
Publicado: (2024)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
por: Cheng, Zixu, et al.
Publicado: (2025)
por: Cheng, Zixu, et al.
Publicado: (2025)
Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation
por: Yang, Sicheng, et al.
Publicado: (2025)
por: Yang, Sicheng, et al.
Publicado: (2025)
ScalingNoise: Scaling Inference-Time Search for Generating Infinite Videos
por: Yang, Haolin, et al.
Publicado: (2025)
por: Yang, Haolin, et al.
Publicado: (2025)
Adaptive Inference-Time Scaling via Cyclic Diffusion Search
por: Lee, Gyubin, et al.
Publicado: (2025)
por: Lee, Gyubin, et al.
Publicado: (2025)
CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning
por: Krestenitis, Marios, et al.
Publicado: (2026)
por: Krestenitis, Marios, et al.
Publicado: (2026)
Unlocking the Potential of Diffusion Priors in Blind Face Restoration
por: Miao, Yunqi, et al.
Publicado: (2025)
por: Miao, Yunqi, et al.
Publicado: (2025)
Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation
por: Ye, Jinyan, et al.
Publicado: (2026)
por: Ye, Jinyan, et al.
Publicado: (2026)
FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation
por: Jiang, Chenhan, et al.
Publicado: (2026)
por: Jiang, Chenhan, et al.
Publicado: (2026)
EmoCLIP: A Vision-Language Method for Zero-Shot Video Facial Expression Recognition
por: Foteinopoulou, Niki Maria, et al.
Publicado: (2023)
por: Foteinopoulou, Niki Maria, et al.
Publicado: (2023)
Sample, Scrutinize and Scale: Effective Inference-Time Search by Scaling Verification
por: Zhao, Eric, et al.
Publicado: (2025)
por: Zhao, Eric, et al.
Publicado: (2025)
SAGS: Structure-Aware 3D Gaussian Splatting
por: Ververas, Evangelos, et al.
Publicado: (2024)
por: Ververas, Evangelos, et al.
Publicado: (2024)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
por: Cheng, Zixu, et al.
Publicado: (2026)
por: Cheng, Zixu, et al.
Publicado: (2026)
VidCtx: Context-aware Video Question Answering with Image Models
por: Goulas, Andreas, et al.
Publicado: (2024)
por: Goulas, Andreas, et al.
Publicado: (2024)
Confidence Should Be Calibrated More Than One Turn Deep
por: Zhang, Zhaohan, et al.
Publicado: (2026)
por: Zhang, Zhaohan, et al.
Publicado: (2026)
LLM Based Bayesian Optimization for Prompt Search
por: Ballew, Adam, et al.
Publicado: (2025)
por: Ballew, Adam, et al.
Publicado: (2025)
Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
ARGS: Alignment as Reward-Guided Search
por: Khanov, Maxim, et al.
Publicado: (2024)
por: Khanov, Maxim, et al.
Publicado: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
por: Luo, Dezhao, et al.
Publicado: (2024)
por: Luo, Dezhao, et al.
Publicado: (2024)
Inference-Time Alignment in Diffusion Models with Reward-Guided Generation: Tutorial and Review
por: Uehara, Masatoshi, et al.
Publicado: (2025)
por: Uehara, Masatoshi, et al.
Publicado: (2025)
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
por: Wen, Tongyu, et al.
Publicado: (2026)
por: Wen, Tongyu, et al.
Publicado: (2026)
MM2Latent: Text-to-facial image generation and editing in GANs with multimodal assistance
por: Meng, Debin, et al.
Publicado: (2024)
por: Meng, Debin, et al.
Publicado: (2024)
Dynamic Search for Inference-Time Alignment in Diffusion Models
por: Li, Xiner, et al.
Publicado: (2025)
por: Li, Xiner, et al.
Publicado: (2025)
ETS: Efficient Tree Search for Inference-Time Scaling
por: Hooper, Coleman, et al.
Publicado: (2025)
por: Hooper, Coleman, et al.
Publicado: (2025)
Ejemplares similares
-
Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation
por: Zhao, Zengqun, et al.
Publicado: (2026) -
AIM-Fair: Advancing Algorithmic Fairness via Selectively Fine-Tuning Biased Models with Contextual Synthetic Data
por: Zhao, Zengqun, et al.
Publicado: (2025) -
Temporal Score Analysis for Understanding and Correcting Diffusion Artifacts
por: Cao, Yu, et al.
Publicado: (2025) -
Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer
por: Zhao, Zengqun, et al.
Publicado: (2024) -
Prompting Visual-Language Models for Dynamic Facial Expression Recognition
por: Zhao, Zengqun, et al.
Publicado: (2023)