Clink! Chop! Thud! -- Learning Object Sounds from Real-World Interactions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Mengyu, Chen, Yiming, Pei, Haozheng, Agarwal, Siddhant, Vasudevan, Arun Balajee, Hays, James |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
par: Bansal, Siddhant, et autres
Publié: (2024)
par: Bansal, Siddhant, et autres
Publié: (2024)
Reconstructing Objects along Hand Interaction Timelines in Egocentric Video
par: Zhu, Zhifan, et autres
Publié: (2025)
par: Zhu, Zhifan, et autres
Publié: (2025)
ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects
par: Yang, Jing, et autres
Publié: (2026)
par: Yang, Jing, et autres
Publié: (2026)
Live Interactive Training for Video Segmentation
par: Yang, Xinyu, et autres
Publié: (2026)
par: Yang, Xinyu, et autres
Publié: (2026)
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
par: Xia, Hongchi, et autres
Publié: (2024)
par: Xia, Hongchi, et autres
Publié: (2024)
WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes
par: Hu, Jichen, et autres
Publié: (2026)
par: Hu, Jichen, et autres
Publié: (2026)
Self-Supervised Learning for Real-World Object Detection: a Survey
par: Ciocarlan, Alina, et autres
Publié: (2024)
par: Ciocarlan, Alina, et autres
Publié: (2024)
Learning Object-Centric Representations Based on Slots in Real World Scenarios
par: Akan, Adil Kaan
Publié: (2025)
par: Akan, Adil Kaan
Publié: (2025)
Streamlining the Development of Active Learning Methods in Real-World Object Detection
par: Sbeyti, Moussa Kassem, et autres
Publié: (2025)
par: Sbeyti, Moussa Kassem, et autres
Publié: (2025)
Physics-Informed Learning of Characteristic Trajectories for Smoke Reconstruction
par: Wang, Yiming, et autres
Publié: (2024)
par: Wang, Yiming, et autres
Publié: (2024)
OAT: Object-Level Attention Transformer for Gaze Scanpath Prediction
par: Fang, Yini, et autres
Publié: (2024)
par: Fang, Yini, et autres
Publié: (2024)
Chimera: Compositional Image Generation using Part-based Concepting
par: Singh, Shivam, et autres
Publié: (2025)
par: Singh, Shivam, et autres
Publié: (2025)
Open World Object Detection: A Survey
par: Li, Yiming, et autres
Publié: (2024)
par: Li, Yiming, et autres
Publié: (2024)
Hearing Hands: Generating Sounds from Physical Interactions in 3D Scenes
par: Dou, Yiming, et autres
Publié: (2025)
par: Dou, Yiming, et autres
Publié: (2025)
Benchmarking Object Detectors under Real-World Distribution Shifts in Satellite Imagery
par: Al-Emadi, Sara, et autres
Publié: (2025)
par: Al-Emadi, Sara, et autres
Publié: (2025)
WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models
par: Gu, Bohai, et autres
Publié: (2026)
par: Gu, Bohai, et autres
Publié: (2026)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
par: Yang, Jie, et autres
Publié: (2024)
par: Yang, Jie, et autres
Publié: (2024)
TrackDeform3D: Markerless and Autonomous 3D Keypoint Tracking and Dataset Collection for Deformable Objects
par: Zong, Yeheng, et autres
Publié: (2026)
par: Zong, Yeheng, et autres
Publié: (2026)
IntrinsicReal: Adapting IntrinsicAnything from Synthetic to Real Objects
par: Wei, Xiaokang, et autres
Publié: (2025)
par: Wei, Xiaokang, et autres
Publié: (2025)
YOLO-World: Real-Time Open-Vocabulary Object Detection
par: Cheng, Tianheng, et autres
Publié: (2024)
par: Cheng, Tianheng, et autres
Publié: (2024)
SDVPT: Semantic-Driven Visual Prompt Tuning for Open-World Object Counting
par: Zhao, Yiming, et autres
Publié: (2025)
par: Zhao, Yiming, et autres
Publié: (2025)
LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model
par: Gao, Quankai, et autres
Publié: (2026)
par: Gao, Quankai, et autres
Publié: (2026)
CIS-BA: Continuous Interaction Space Based Backdoor Attack for Object Detection in the Real-World
par: Zhao, Shuxin, et autres
Publié: (2025)
par: Zhao, Shuxin, et autres
Publié: (2025)
XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions
par: Chen, Chih-Hsin, et autres
Publié: (2026)
par: Chen, Chih-Hsin, et autres
Publié: (2026)
PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing
par: Xu, Ruihang, et autres
Publié: (2026)
par: Xu, Ruihang, et autres
Publié: (2026)
TUMTraf EMOT: Event-Based Multi-Object Tracking Dataset and Baseline for Traffic Scenarios
par: Li, Mengyu, et autres
Publié: (2025)
par: Li, Mengyu, et autres
Publié: (2025)
Beyond Pixels: Text Enhances Generalization in Real-World Image Restoration
par: Sun, Haoze, et autres
Publié: (2024)
par: Sun, Haoze, et autres
Publié: (2024)
Towards Generalizable Deepfake Detection with Spatial-Frequency Collaborative Learning and Hierarchical Cross-Modal Fusion
par: Qiao, Mengyu, et autres
Publié: (2025)
par: Qiao, Mengyu, et autres
Publié: (2025)
POV: Prompt-Oriented View-Agnostic Learning for Egocentric Hand-Object Interaction in the Multi-View World
par: Xu, Boshen, et autres
Publié: (2024)
par: Xu, Boshen, et autres
Publié: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
par: Zhang, Zhenhao, et autres
Publié: (2025)
par: Zhang, Zhenhao, et autres
Publié: (2025)
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
par: Huang, Yifei, et autres
Publié: (2024)
par: Huang, Yifei, et autres
Publié: (2024)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
par: Bharadwaj, Siddhant, et autres
Publié: (2026)
par: Bharadwaj, Siddhant, et autres
Publié: (2026)
InteractAnything: Zero-shot Human Object Interaction Synthesis via LLM Feedback and Object Affordance Parsing
par: Zhang, Jinlu, et autres
Publié: (2025)
par: Zhang, Jinlu, et autres
Publié: (2025)
ClickTrack: Towards Real-time Interactive Single Object Tracking
par: Wang, Kuiran, et autres
Publié: (2024)
par: Wang, Kuiran, et autres
Publié: (2024)
Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
par: Wang, Zile, et autres
Publié: (2026)
par: Wang, Zile, et autres
Publié: (2026)
Objects With Lighting: A Real-World Dataset for Evaluating Reconstruction and Rendering for Object Relighting
par: Ummenhofer, Benjamin, et autres
Publié: (2024)
par: Ummenhofer, Benjamin, et autres
Publié: (2024)
Learning Human-Object Interaction as Groups
par: Hong, Jiajun, et autres
Publié: (2025)
par: Hong, Jiajun, et autres
Publié: (2025)
Single-Slice-to-3D Reconstruction in Medical Imaging and Natural Objects: A Comparative Benchmark with SAM 3D
par: Luo, Yan, et autres
Publié: (2026)
par: Luo, Yan, et autres
Publié: (2026)
Object-Centric Learning for Real-World Videos by Predicting Temporal Feature Similarities
par: Zadaianchuk, Andrii, et autres
Publié: (2023)
par: Zadaianchuk, Andrii, et autres
Publié: (2023)
World Models for Learning Dexterous Hand-Object Interactions from Human Videos
par: Goswami, Raktim Gautam, et autres
Publié: (2025)
par: Goswami, Raktim Gautam, et autres
Publié: (2025)
Documents similaires
-
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
par: Bansal, Siddhant, et autres
Publié: (2024) -
Reconstructing Objects along Hand Interaction Timelines in Egocentric Video
par: Zhu, Zhifan, et autres
Publié: (2025) -
ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objects
par: Yang, Jing, et autres
Publié: (2026) -
Live Interactive Training for Video Segmentation
par: Yang, Xinyu, et autres
Publié: (2026) -
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
par: Xia, Hongchi, et autres
Publié: (2024)