Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Yuqian, Wang, Runze, Fu, Yanwei, Paudel, Danda Pani, Van Gool, Luc |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
di: Fu, Yuqian, et al.
Pubblicazione: (2024)
di: Fu, Yuqian, et al.
Pubblicazione: (2024)
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025)
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence
di: Pan, Jiancheng, et al.
Pubblicazione: (2025)
di: Pan, Jiancheng, et al.
Pubblicazione: (2025)
Vision encoders should be image size agnostic and task driven
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
Self-supervised pretraining for an iterative image size agnostic vision transformer
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2026)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2026)
EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark
di: Zhang, Deheng, et al.
Pubblicazione: (2025)
di: Zhang, Deheng, et al.
Pubblicazione: (2025)
EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation
di: Zhang, Ganlin, et al.
Pubblicazione: (2023)
di: Zhang, Ganlin, et al.
Pubblicazione: (2023)
BiXFormer: A Robust Framework for Maximizing Modality Effectiveness in Multi-Modal Semantic Segmentation
di: Chen, Jialei, et al.
Pubblicazione: (2025)
di: Chen, Jialei, et al.
Pubblicazione: (2025)
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
A Simple and Generalist Approach for Panoptic Segmentation
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2024)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2024)
EvenNICER-SLAM: Event-based Neural Implicit Encoding SLAM
di: Chen, Shi, et al.
Pubblicazione: (2024)
di: Chen, Shi, et al.
Pubblicazione: (2024)
Inferring Compositional 4D Scenes without Ever Seeing One
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
Implicit-Zoo: A Large-Scale Dataset of Neural Implicit Functions for 2D Images and 3D Scenes
di: Ma, Qi, et al.
Pubblicazione: (2024)
di: Ma, Qi, et al.
Pubblicazione: (2024)
Leveraging Driver Field-of-View for Multimodal Ego-Trajectory Prediction
di: Akbiyik, M. Eren, et al.
Pubblicazione: (2023)
di: Akbiyik, M. Eren, et al.
Pubblicazione: (2023)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
Event-Free Moving Object Segmentation from Moving Ego Vehicle
di: Zhou, Zhuyun, et al.
Pubblicazione: (2023)
di: Zhou, Zhuyun, et al.
Pubblicazione: (2023)
Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models
di: Motamed, Saman, et al.
Pubblicazione: (2023)
di: Motamed, Saman, et al.
Pubblicazione: (2023)
Continuous Pose for Monocular Cameras in Neural Implicit Representation
di: Ma, Qi, et al.
Pubblicazione: (2023)
di: Ma, Qi, et al.
Pubblicazione: (2023)
Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
Learning Generative Interactive Environments By Trained Agent Exploration
di: Kazemi, Naser, et al.
Pubblicazione: (2024)
di: Kazemi, Naser, et al.
Pubblicazione: (2024)
SeasonScapes: Learning Large-scale Re-lightable 3D Landscapes with Seasonal Variation from Sparse Webcams
di: Kleger, Timo, et al.
Pubblicazione: (2026)
di: Kleger, Timo, et al.
Pubblicazione: (2026)
RICO: Two Realistic Benchmarks and an In-Depth Analysis for Incremental Learning in Object Detection
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
Incremental Object Detection with Prompt-based Methods
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
Occam's LGS: An Efficient Approach for Language Gaussian Splatting
di: Cheng, Jiahuan, et al.
Pubblicazione: (2024)
di: Cheng, Jiahuan, et al.
Pubblicazione: (2024)
Locate Anything on Earth: Advancing Open-Vocabulary Object Detection for Remote Sensing Community
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
Accelerating Vision Foundation Models with Drop-in Depthwise Convolution
di: Scribano, Carmelo, et al.
Pubblicazione: (2026)
di: Scribano, Carmelo, et al.
Pubblicazione: (2026)
Partial CLIP is Enough: Chimera-Seg for Zero-shot Semantic Segmentation
di: Chen, Jialei, et al.
Pubblicazione: (2025)
di: Chen, Jialei, et al.
Pubblicazione: (2025)
Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation
di: Markov, Mario, et al.
Pubblicazione: (2026)
di: Markov, Mario, et al.
Pubblicazione: (2026)
Ternary-Type Opacity and Hybrid Odometry for RGB NeRF-SLAM
di: Lin, Junru, et al.
Pubblicazione: (2023)
di: Lin, Junru, et al.
Pubblicazione: (2023)
LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation
di: Miao, Yang, et al.
Pubblicazione: (2025)
di: Miao, Yang, et al.
Pubblicazione: (2025)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization
di: Ren, Bin, et al.
Pubblicazione: (2025)
di: Ren, Bin, et al.
Pubblicazione: (2025)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
ReVLA: Reverting Visual Domain Limitation of Robotic Foundation Models
di: Dey, Sombit, et al.
Pubblicazione: (2024)
di: Dey, Sombit, et al.
Pubblicazione: (2024)
Rethinking Global Context in Crowd Counting
di: Sun, Guolei, et al.
Pubblicazione: (2021)
di: Sun, Guolei, et al.
Pubblicazione: (2021)
Exploration-Driven Generative Interactive Environments
di: Savov, Nedko, et al.
Pubblicazione: (2025)
di: Savov, Nedko, et al.
Pubblicazione: (2025)
StateSpaceDiffuser: Bringing Long Context to Diffusion World Models
di: Savov, Nedko, et al.
Pubblicazione: (2025)
di: Savov, Nedko, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
di: Fu, Yuqian, et al.
Pubblicazione: (2024) -
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
di: Mahdi, Mohammad, et al.
Pubblicazione: (2025) -
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026) -
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025) -
V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence
di: Pan, Jiancheng, et al.
Pubblicazione: (2025)