Visual Acoustic Fields
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yuelei, Kim, Hyunjin, Zhan, Fangneng, Qiu, Ri-Zhao, Ji, Mazeyu, Shan, Xiaojun, Zou, Xueyan, Liang, Paul, Pfister, Hanspeter, Wang, Xiaolong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GraspSplats: Efficient Manipulation with 3D Feature Splatting
di: Ji, Mazeyu, et al.
Pubblicazione: (2024)
di: Ji, Mazeyu, et al.
Pubblicazione: (2024)
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
di: Xu, Tianling, et al.
Pubblicazione: (2025)
di: Xu, Tianling, et al.
Pubblicazione: (2025)
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
GSWorld: Closed-Loop Photo-Realistic Simulation Suite for Robotic Manipulation
di: Jiang, Guangqi, et al.
Pubblicazione: (2025)
di: Jiang, Guangqi, et al.
Pubblicazione: (2025)
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
di: Gu, Leslie, et al.
Pubblicazione: (2025)
di: Gu, Leslie, et al.
Pubblicazione: (2025)
WildLMa: Long Horizon Loco-Manipulation in the Wild
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2024)
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2024)
M3: 3D-Spatial MultiModal Memory
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
Advances in Feed-Forward 3D Reconstruction and View Synthesis: A Survey
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
General Neural Gauge Fields
di: Zhan, Fangneng, et al.
Pubblicazione: (2023)
di: Zhan, Fangneng, et al.
Pubblicazione: (2023)
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
di: Hou, Karly, et al.
Pubblicazione: (2025)
di: Hou, Karly, et al.
Pubblicazione: (2025)
Lite2Relight: 3D-aware Single Image Portrait Relighting
di: Rao, Pramod, et al.
Pubblicazione: (2024)
di: Rao, Pramod, et al.
Pubblicazione: (2024)
Gaussian-Augmented Physics Simulation and System Identification with Complex Colliders
di: Vasile, Federico, et al.
Pubblicazione: (2025)
di: Vasile, Federico, et al.
Pubblicazione: (2025)
DatasetNeRF: Efficient 3D-aware Data Factory with Generative Radiance Fields
di: Chi, Yu, et al.
Pubblicazione: (2023)
di: Chi, Yu, et al.
Pubblicazione: (2023)
Stream3D: Sequential Multi-View 3D Generation via Evidential Memory
di: Zhou, Kaichen, et al.
Pubblicazione: (2026)
di: Zhou, Kaichen, et al.
Pubblicazione: (2026)
Visual Whole-Body Control for Legged Loco-Manipulation
di: Liu, Minghuan, et al.
Pubblicazione: (2024)
di: Liu, Minghuan, et al.
Pubblicazione: (2024)
LoRA-TTT: Low-Rank Test-Time Training for Vision-Language Models
di: Kojima, Yuto, et al.
Pubblicazione: (2025)
di: Kojima, Yuto, et al.
Pubblicazione: (2025)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
di: Lalai, Harsh Nishant, et al.
Pubblicazione: (2026)
di: Lalai, Harsh Nishant, et al.
Pubblicazione: (2026)
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
di: Liu, Yilong, et al.
Pubblicazione: (2026)
di: Liu, Yilong, et al.
Pubblicazione: (2026)
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
di: Wu, Chenyu, et al.
Pubblicazione: (2026)
di: Wu, Chenyu, et al.
Pubblicazione: (2026)
Joint-Task Regularization for Partially Labeled Multi-Task Learning
di: Nishi, Kento, et al.
Pubblicazione: (2024)
di: Nishi, Kento, et al.
Pubblicazione: (2024)
Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks
di: Kim, Jonghun, et al.
Pubblicazione: (2026)
di: Kim, Jonghun, et al.
Pubblicazione: (2026)
DiffAge3D: Diffusion-based 3D-aware Face Aging
di: Wahid, Junaid, et al.
Pubblicazione: (2024)
di: Wahid, Junaid, et al.
Pubblicazione: (2024)
SOGS: Second-Order Anchor for Advanced 3D Gaussian Splatting
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
di: He, Jixuan, et al.
Pubblicazione: (2024)
di: He, Jixuan, et al.
Pubblicazione: (2024)
MoRA: LoRA Guided Multi-Modal Disease Diagnosis with Missing Modality
di: Shi, Zhiyi, et al.
Pubblicazione: (2024)
di: Shi, Zhiyi, et al.
Pubblicazione: (2024)
3DPR: Single Image 3D Portrait Relight using Generative Priors
di: Rao, Pramod, et al.
Pubblicazione: (2025)
di: Rao, Pramod, et al.
Pubblicazione: (2025)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
di: Guo, Grace, et al.
Pubblicazione: (2024)
di: Guo, Grace, et al.
Pubblicazione: (2024)
LangSplat: 3D Language Gaussian Splatting
di: Qin, Minghan, et al.
Pubblicazione: (2023)
di: Qin, Minghan, et al.
Pubblicazione: (2023)
Towards 1000-fold Electron Microscopy Image Compression for Connectomics via VQ-VAE with Transformer Prior
di: Yang, Fuming, et al.
Pubblicazione: (2025)
di: Yang, Fuming, et al.
Pubblicazione: (2025)
PartSTAD: 2D-to-3D Part Segmentation Task Adaptation
di: Kim, Hyunjin, et al.
Pubblicazione: (2024)
di: Kim, Hyunjin, et al.
Pubblicazione: (2024)
Simulating Post-Neoadjuvant Chemotherapy Breast Cancer MRI via Diffusion Model with Prompt Tuning
di: Kim, Jonghun, et al.
Pubblicazione: (2025)
di: Kim, Jonghun, et al.
Pubblicazione: (2025)
FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
di: Zhang, Jiahui, et al.
Pubblicazione: (2024)
MuSASplat: Efficient Sparse-View 3D Gaussian Splats via Lightweight Multi-Scale Adaptation
di: Xu, Muyu, et al.
Pubblicazione: (2025)
di: Xu, Muyu, et al.
Pubblicazione: (2025)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
PAGE-4D: VGGT-4D Perception via Disentangled Pose and Geometry Estimation
di: Zhou, Kaichen, et al.
Pubblicazione: (2025)
di: Zhou, Kaichen, et al.
Pubblicazione: (2025)
Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models
di: Magid, Salma Abdel, et al.
Pubblicazione: (2024)
di: Magid, Salma Abdel, et al.
Pubblicazione: (2024)
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
S$^3$-TTA: Scale-Style Selection for Test-Time Augmentation in Biomedical Image Segmentation
di: Xie, Kangxian, et al.
Pubblicazione: (2023)
di: Xie, Kangxian, et al.
Pubblicazione: (2023)
SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization
di: Li, Wanhua, et al.
Pubblicazione: (2024)
di: Li, Wanhua, et al.
Pubblicazione: (2024)
Documenti analoghi
-
GraspSplats: Efficient Manipulation with 3D Feature Splatting
di: Ji, Mazeyu, et al.
Pubblicazione: (2024) -
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
di: Xu, Tianling, et al.
Pubblicazione: (2025) -
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
di: Liu, Yifan, et al.
Pubblicazione: (2025) -
GSWorld: Closed-Loop Photo-Realistic Simulation Suite for Robotic Manipulation
di: Jiang, Guangqi, et al.
Pubblicazione: (2025) -
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
di: Liu, Yifan, et al.
Pubblicazione: (2025)