EgoForge: Goal-Directed Egocentric World Simulator
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Yifan, Liu, Jiateng, Li, Xinzhuo, Liu, Yuanzhe, Li, Bingxuan, Yang, Houze, Jia, Wenqi, Li, Yijiang, Yu, Tianjiao, Rehg, James Matthew, Cao, Xu, Lourentzou, Ismini |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
Toward Cognitive Supersensing in Multimodal Large Language Model
di: Li, Boyi, et al.
Pubblicazione: (2026)
di: Li, Boyi, et al.
Pubblicazione: (2026)
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
di: Yu, Tianjiao, et al.
Pubblicazione: (2026)
di: Yu, Tianjiao, et al.
Pubblicazione: (2026)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
Unsupervised Ego- and Exo-centric Dense Procedural Activity Captioning via Gaze Consensus Adaptation
di: Shi, Zhaofeng, et al.
Pubblicazione: (2025)
di: Shi, Zhaofeng, et al.
Pubblicazione: (2025)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
di: Hao, Fangyu, et al.
Pubblicazione: (2026)
di: Hao, Fangyu, et al.
Pubblicazione: (2026)
Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
Learning Switchable Priors for Neural Image Compression
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
di: Liu, Shuo, et al.
Pubblicazione: (2024)
di: Liu, Shuo, et al.
Pubblicazione: (2024)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
SRA: Semantic Relation-Aware Flowchart Question Answering
di: Li, Xinyu, et al.
Pubblicazione: (2026)
di: Li, Xinyu, et al.
Pubblicazione: (2026)
PopSim: Social Network Simulation for Social Media Popularity Prediction
di: Liu, Yijun, et al.
Pubblicazione: (2025)
di: Liu, Yijun, et al.
Pubblicazione: (2025)
M3ST-DTI: A multi-task learning model for drug-target interactions based on multi-modal features and multi-stage alignment
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
di: Li, Xinzhuo, et al.
Pubblicazione: (2025)
di: Li, Xinzhuo, et al.
Pubblicazione: (2025)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
di: Zhou, Qianrui, et al.
Pubblicazione: (2026)
di: Zhou, Qianrui, et al.
Pubblicazione: (2026)
Exploring the Role of Audio in Multimodal Misinformation Detection
di: Liu, Moyang, et al.
Pubblicazione: (2024)
di: Liu, Moyang, et al.
Pubblicazione: (2024)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
Voxel-GS: Quantized Scaffold Gaussian Splatting Compression with Run-Length Coding
di: Fu, Chunyang, et al.
Pubblicazione: (2025)
di: Fu, Chunyang, et al.
Pubblicazione: (2025)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
di: Wang, Tianshi, et al.
Pubblicazione: (2023)
di: Wang, Tianshi, et al.
Pubblicazione: (2023)
WorldGPT: Empowering LLM as Multimodal World Model
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
Feature Coding in the Era of Large Models: Dataset, Test Conditions, and Benchmark
di: Gao, Changsheng, et al.
Pubblicazione: (2024)
di: Gao, Changsheng, et al.
Pubblicazione: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
di: Wang, Anna, et al.
Pubblicazione: (2024)
di: Wang, Anna, et al.
Pubblicazione: (2024)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
di: Xu, Zhaoyang, et al.
Pubblicazione: (2026)
StreamOptix: A Cross-layer Adaptive Video Delivery Scheme
di: Liu, Mufan, et al.
Pubblicazione: (2024)
di: Liu, Mufan, et al.
Pubblicazione: (2024)
SAFIRE: Segment Any Forged Image Region
di: Kwon, Myung-Joon, et al.
Pubblicazione: (2024)
di: Kwon, Myung-Joon, et al.
Pubblicazione: (2024)
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
di: Gao, Zhilin, et al.
Pubblicazione: (2025)
di: Gao, Zhilin, et al.
Pubblicazione: (2025)
Diffusion Model-Based Size Variable Virtual Try-On Technology and Evaluation Method
di: Zhang, Shufang, et al.
Pubblicazione: (2025)
di: Zhang, Shufang, et al.
Pubblicazione: (2025)
CDI-DTI: A Strong Cross-domain Interpretable Drug-Target Interaction Prediction Framework Based on Multi-Strategy Fusion
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
Universal Organizer of SAM for Unsupervised Semantic Segmentation
di: Li, Tingting, et al.
Pubblicazione: (2024)
di: Li, Tingting, et al.
Pubblicazione: (2024)
ChartAdapter: Large Vision-Language Model for Chart Summarization
di: Xu, Peixin, et al.
Pubblicazione: (2024)
di: Xu, Peixin, et al.
Pubblicazione: (2024)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
di: Zhang, Meishan, et al.
Pubblicazione: (2024)
di: Zhang, Meishan, et al.
Pubblicazione: (2024)
A Large-scale Dataset with Behavior, Attributes, and Content of Mobile Short-video Platform
di: Shang, Yu, et al.
Pubblicazione: (2025)
di: Shang, Yu, et al.
Pubblicazione: (2025)
Hybrid CNN-Mamba Enhancement Network for Robust Multimodal Sentiment Analysis
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
di: Yu, Tianjiao, et al.
Pubblicazione: (2025) -
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025) -
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026) -
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025) -
Toward Cognitive Supersensing in Multimodal Large Language Model
di: Li, Boyi, et al.
Pubblicazione: (2026)