MVPbev: Multi-view Perspective Image Generation from BEV with Test-time Controllability and Generalizability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Buyu, Wang, Kai, Liu, Yansong, Bao, Jun, Han, Tingting, Yu, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
par: Wang, Bing, et autres
Publié: (2025)
par: Wang, Bing, et autres
Publié: (2025)
Deep Contrastive Multi-view Clustering under Semantic Feature Guidance
par: Liu, Siwen, et autres
Publié: (2024)
par: Liu, Siwen, et autres
Publié: (2024)
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
par: Liu, Ke, et autres
Publié: (2025)
par: Liu, Ke, et autres
Publié: (2025)
RealX3D: A Physically-Degraded 3D Benchmark for Multi-view Visual Restoration and Reconstruction
par: Liu, Shuhong, et autres
Publié: (2025)
par: Liu, Shuhong, et autres
Publié: (2025)
Simple Yet Effective Selective Imputation for Incomplete Multi-view Clustering
par: Xu, Cai, et autres
Publié: (2025)
par: Xu, Cai, et autres
Publié: (2025)
MHAD: Multimodal Home Activity Dataset with Multi-Angle Videos and Synchronized Physiological Signals
par: Yu, Lei, et autres
Publié: (2024)
par: Yu, Lei, et autres
Publié: (2024)
Rethinking Multi-view Representation Learning via Distilled Disentangling
par: Ke, Guanzhou, et autres
Publié: (2024)
par: Ke, Guanzhou, et autres
Publié: (2024)
PetalView: Fine-grained Location and Orientation Extraction of Street-view Images via Cross-view Local Search with Supplementary Materials
par: Hu, Wenmiao, et autres
Publié: (2024)
par: Hu, Wenmiao, et autres
Publié: (2024)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
par: Liu, Yang, et autres
Publié: (2023)
par: Liu, Yang, et autres
Publié: (2023)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
MTFusion: Reconstructing Any 3D Object from Single Image Using Multi-word Textual Inversion
par: Liu, Yu, et autres
Publié: (2024)
par: Liu, Yu, et autres
Publié: (2024)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
par: Zi, Xing, et autres
Publié: (2025)
par: Zi, Xing, et autres
Publié: (2025)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
par: Ling, Jun, et autres
Publié: (2024)
par: Ling, Jun, et autres
Publié: (2024)
Towards Realistic Low-Light Image Enhancement via ISP Driven Data Modeling
par: Wang, Zhihua, et autres
Publié: (2025)
par: Wang, Zhihua, et autres
Publié: (2025)
Accelerating Controllable Generation via Hybrid-grained Cache
par: Liu, Lin, et autres
Publié: (2025)
par: Liu, Lin, et autres
Publié: (2025)
Generalizable Deepfake Detection Based on Forgery-aware Layer Masking and Multi-artifact Subspace Decomposition
par: Zhang, Xiang, et autres
Publié: (2026)
par: Zhang, Xiang, et autres
Publié: (2026)
Test-time adaptation for image compression with distribution regularization
par: Chen, Kecheng, et autres
Publié: (2024)
par: Chen, Kecheng, et autres
Publié: (2024)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
par: Wu, Yi, et autres
Publié: (2025)
par: Wu, Yi, et autres
Publié: (2025)
A Light-weight Transformer-based Self-supervised Matching Network for Heterogeneous Images
par: Zhang, Wang, et autres
Publié: (2024)
par: Zhang, Wang, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
T$^\text{3}$SVFND: Towards an Evolving Fake News Detector for Emergencies with Test-time Training on Short Video Platforms
par: Zhang, Liyuan, et autres
Publié: (2025)
par: Zhang, Liyuan, et autres
Publié: (2025)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis
par: Liu, Miao, et autres
Publié: (2026)
par: Liu, Miao, et autres
Publié: (2026)
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
par: Yuan, Hangjie, et autres
Publié: (2025)
par: Yuan, Hangjie, et autres
Publié: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
G-Refine: A General Quality Refiner for Text-to-Image Generation
par: Li, Chunyi, et autres
Publié: (2024)
par: Li, Chunyi, et autres
Publié: (2024)
Continual Panoptic Perception: Towards Multi-modal Incremental Interpretation of Remote Sensing Images
par: Yuan, Bo, et autres
Publié: (2024)
par: Yuan, Bo, et autres
Publié: (2024)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
par: Zhu, Yixin, et autres
Publié: (2026)
par: Zhu, Yixin, et autres
Publié: (2026)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
par: Cai, Qi, et autres
Publié: (2026)
par: Cai, Qi, et autres
Publié: (2026)
Memories are One-to-Many Mapping Alleviators in Talking Face Generation
par: Tang, Anni, et autres
Publié: (2022)
par: Tang, Anni, et autres
Publié: (2022)
Regularized Contrastive Partial Multi-view Outlier Detection
par: Wang, Yijia, et autres
Publié: (2024)
par: Wang, Yijia, et autres
Publié: (2024)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
par: Gao, Jiayi, et autres
Publié: (2025)
par: Gao, Jiayi, et autres
Publié: (2025)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
par: Huang, Yuesheng, et autres
Publié: (2025)
par: Huang, Yuesheng, et autres
Publié: (2025)
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
par: Zhang, Xiaoyu, et autres
Publié: (2025)
par: Zhang, Xiaoyu, et autres
Publié: (2025)
On-the-Fly Object-aware Representative Point Selection in Point Cloud
par: Zhang, Xiaoyu, et autres
Publié: (2025)
par: Zhang, Xiaoyu, et autres
Publié: (2025)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
par: Wang, Xue, et autres
Publié: (2026)
par: Wang, Xue, et autres
Publié: (2026)
A Perspective on Deep Vision Performance with Standard Image and Video Codecs
par: Reich, Christoph, et autres
Publié: (2024)
par: Reich, Christoph, et autres
Publié: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Documents similaires
-
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
par: Wang, Bing, et autres
Publié: (2025) -
Deep Contrastive Multi-view Clustering under Semantic Feature Guidance
par: Liu, Siwen, et autres
Publié: (2024) -
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
par: Liu, Ke, et autres
Publié: (2025) -
RealX3D: A Physically-Degraded 3D Benchmark for Multi-view Visual Restoration and Reconstruction
par: Liu, Shuhong, et autres
Publié: (2025) -
Simple Yet Effective Selective Imputation for Incomplete Multi-view Clustering
par: Xu, Cai, et autres
Publié: (2025)