Guardado en:
| Autores principales: | Huang, Zixuan, Li, Xiang, Lv, Zhaoyang, Rehg, James M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2512.19949 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vinedresser3D: Agentic Text-guided 3D Editing
por: Chi, Yankuan, et al.
Publicado: (2026)
por: Chi, Yankuan, et al.
Publicado: (2026)
Cue3D: Quantifying the Role of Image Cues in Single-Image 3D Generation
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
Symmetry Strikes Back: From Single-Image Symmetry Detection to 3D Generation
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
How Much Do Large Language Models Know about Human Motion? A Case Study in 3D Avatar Control
por: Li, Kunhang, et al.
Publicado: (2025)
por: Li, Kunhang, et al.
Publicado: (2025)
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
por: Kim, Junho, et al.
Publicado: (2026)
por: Kim, Junho, et al.
Publicado: (2026)
MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model
por: Tong, Jinguang, et al.
Publicado: (2026)
por: Tong, Jinguang, et al.
Publicado: (2026)
Yan: Foundational Interactive Video Generation
por: Ye, Deheng, et al.
Publicado: (2025)
por: Ye, Deheng, et al.
Publicado: (2025)
How Much You Ate? Food Portion Estimation on Spoons
por: Sharma, Aaryam, et al.
Publicado: (2024)
por: Sharma, Aaryam, et al.
Publicado: (2024)
Guess the Unified Model: How Much Can We Recover from Generated Images?
por: Cekinmez, Jasin, et al.
Publicado: (2026)
por: Cekinmez, Jasin, et al.
Publicado: (2026)
Medical Video Generation for Disease Progression Simulation
por: Cao, Xu, et al.
Publicado: (2024)
por: Cao, Xu, et al.
Publicado: (2024)
SGP-SAM: Self-Gated Prompting for Transferring 3D Segment Anything Models to Lesion Segmentation
por: Tang, Zixuan, et al.
Publicado: (2026)
por: Tang, Zixuan, et al.
Publicado: (2026)
Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index
por: Yuan, Chao, et al.
Publicado: (2026)
por: Yuan, Chao, et al.
Publicado: (2026)
Do Pre-trained Vision-Language Models Encode Object States?
por: Newman, Kaleb, et al.
Publicado: (2024)
por: Newman, Kaleb, et al.
Publicado: (2024)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
por: Zhang, Huixuan, et al.
Publicado: (2025)
por: Zhang, Huixuan, et al.
Publicado: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video
por: Gao, Zihui, et al.
Publicado: (2026)
por: Gao, Zihui, et al.
Publicado: (2026)
SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images
por: Huang, Zixuan, et al.
Publicado: (2025)
por: Huang, Zixuan, et al.
Publicado: (2025)
Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study
por: Jing, Yixiao, et al.
Publicado: (2026)
por: Jing, Yixiao, et al.
Publicado: (2026)
Towards Efficient Benchmarking of Foundation Models in Remote Sensing: A Capabilities Encoding Approach
por: Adorni, Pierre, et al.
Publicado: (2025)
por: Adorni, Pierre, et al.
Publicado: (2025)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
por: Yu, Ting, et al.
Publicado: (2024)
por: Yu, Ting, et al.
Publicado: (2024)
A Generative Foundation Model for Multimodal Histopathology
por: Xiang, Jinxi, et al.
Publicado: (2026)
por: Xiang, Jinxi, et al.
Publicado: (2026)
When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection
por: Kim, Jihyeon, et al.
Publicado: (2026)
por: Kim, Jihyeon, et al.
Publicado: (2026)
MetaSSC: Enhancing 3D Semantic Scene Completion for Autonomous Driving through Meta-Learning and Long-sequence Modeling
por: Qu, Yansong, et al.
Publicado: (2024)
por: Qu, Yansong, et al.
Publicado: (2024)
FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
por: Zuo, Xingxing, et al.
Publicado: (2024)
por: Zuo, Xingxing, et al.
Publicado: (2024)
How Far are AI-generated Videos from Simulating the 3D Visual World: A Learned 3D Evaluation Approach
por: Chang, Chirui, et al.
Publicado: (2024)
por: Chang, Chirui, et al.
Publicado: (2024)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
por: Yu, Zhuang, et al.
Publicado: (2026)
por: Yu, Zhuang, et al.
Publicado: (2026)
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
por: Zheng, Duo, et al.
Publicado: (2025)
por: Zheng, Duo, et al.
Publicado: (2025)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
por: Huang, YiJie, et al.
Publicado: (2026)
por: Huang, YiJie, et al.
Publicado: (2026)
Triad: Vision Foundation Model for 3D Magnetic Resonance Imaging
por: Wang, Shansong, et al.
Publicado: (2025)
por: Wang, Shansong, et al.
Publicado: (2025)
PlaneCycle: Training-Free 2D-to-3D Lifting of Foundation Models Without Adapters
por: Yu, Yinghong, et al.
Publicado: (2026)
por: Yu, Yinghong, et al.
Publicado: (2026)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
por: Linghu, Xiongkun, et al.
Publicado: (2026)
por: Linghu, Xiongkun, et al.
Publicado: (2026)
SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input
por: Lv, Zhen, et al.
Publicado: (2024)
por: Lv, Zhen, et al.
Publicado: (2024)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
por: Fan, Yingqi, et al.
Publicado: (2026)
por: Fan, Yingqi, et al.
Publicado: (2026)
3D Foundation Model for Generalizable Disease Detection in Head Computed Tomography
por: Zhu, Weicheng, et al.
Publicado: (2025)
por: Zhu, Weicheng, et al.
Publicado: (2025)
M$^3$-VOS: Multi-Phase, Multi-Transition, and Multi-Scenery Video Object Segmentation
por: Chen, Zixuan, et al.
Publicado: (2024)
por: Chen, Zixuan, et al.
Publicado: (2024)
Few-shot Semantic Encoding and Decoding for Video Surveillance
por: Cheng, Baoping, et al.
Publicado: (2025)
por: Cheng, Baoping, et al.
Publicado: (2025)
BehAVE: Behaviour Alignment of Video Game Encodings
por: Rašajski, Nemanja, et al.
Publicado: (2024)
por: Rašajski, Nemanja, et al.
Publicado: (2024)
CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video
por: Li, Lingen, et al.
Publicado: (2026)
por: Li, Lingen, et al.
Publicado: (2026)
LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
How Do I Do That? Synthesizing 3D Hand Motion and Contacts for Everyday Interactions
por: Prakash, Aditya, et al.
Publicado: (2025)
por: Prakash, Aditya, et al.
Publicado: (2025)
Ejemplares similares
-
Vinedresser3D: Agentic Text-guided 3D Editing
por: Chi, Yankuan, et al.
Publicado: (2026) -
Cue3D: Quantifying the Role of Image Cues in Single-Image 3D Generation
por: Li, Xiang, et al.
Publicado: (2025) -
Symmetry Strikes Back: From Single-Image Symmetry Detection to 3D Generation
por: Li, Xiang, et al.
Publicado: (2024) -
How Much Do Large Language Models Know about Human Motion? A Case Study in 3D Avatar Control
por: Li, Kunhang, et al.
Publicado: (2025) -
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
por: Kim, Junho, et al.
Publicado: (2026)