Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Zekai, Cai, Zhixi, Stefanov, Kalin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition
di: Xie, Kunyuan, et al.
Pubblicazione: (2026)
di: Xie, Kunyuan, et al.
Pubblicazione: (2026)
DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors
di: Kundu, Kaustubh, et al.
Pubblicazione: (2025)
di: Kundu, Kaustubh, et al.
Pubblicazione: (2025)
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
di: Xiao, Junbin, et al.
Pubblicazione: (2025)
Exploring Audio Hallucination in Egocentric Video Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
1M-Deepfakes Detection Challenge
di: Cai, Zhixi, et al.
Pubblicazione: (2024)
di: Cai, Zhixi, et al.
Pubblicazione: (2024)
What to Do Next? Memorizing skills from Egocentric Instructional Video
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
AV-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset
di: Cai, Zhixi, et al.
Pubblicazione: (2023)
di: Cai, Zhixi, et al.
Pubblicazione: (2023)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2025)
di: Seth, Ashish, et al.
Pubblicazione: (2025)
Comparing Learning Paradigms for Egocentric Video Summarization
di: Wen, Daniel
Pubblicazione: (2025)
di: Wen, Daniel
Pubblicazione: (2025)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
di: Valdez, Hector A., et al.
Pubblicazione: (2024)
di: Valdez, Hector A., et al.
Pubblicazione: (2024)
EgoVLM: Policy Optimization for Egocentric Video Understanding
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
Object-Shot Enhanced Grounding Network for Egocentric Video
di: Feng, Yisen, et al.
Pubblicazione: (2025)
di: Feng, Yisen, et al.
Pubblicazione: (2025)
SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Eyes on Target: Gaze-Aware Object Detection in Egocentric Video
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
GloTSFormer: Global Video Text Spotting Transformer
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
AI's Blind Spots: Geographic Knowledge and Diversity Deficit in Generated Urban Scenario
di: Beneduce, Ciro, et al.
Pubblicazione: (2025)
di: Beneduce, Ciro, et al.
Pubblicazione: (2025)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
di: Deng, Ailin, et al.
Pubblicazione: (2025)
di: Deng, Ailin, et al.
Pubblicazione: (2025)
Zero-Shot Temporal Interaction Localization for Egocentric Videos
di: Zhang, Erhang, et al.
Pubblicazione: (2025)
di: Zhang, Erhang, et al.
Pubblicazione: (2025)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
Blind Spot Navigation: Evolutionary Discovery of Sensitive Semantic Concepts for LVLMs
di: Pan, Zihao, et al.
Pubblicazione: (2025)
di: Pan, Zihao, et al.
Pubblicazione: (2025)
Where It Moves, It Matters: Referring Surgical Instrument Segmentation via Motion
di: Wei, Meng, et al.
Pubblicazione: (2026)
di: Wei, Meng, et al.
Pubblicazione: (2026)
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
di: Li, Runjia, et al.
Pubblicazione: (2025)
di: Li, Runjia, et al.
Pubblicazione: (2025)
EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation
di: Zhang, Libo, et al.
Pubblicazione: (2025)
di: Zhang, Libo, et al.
Pubblicazione: (2025)
AI-Assisted Competency Assessment from Egocentric Video in Simulation-Based Nursing Education
di: Wang, Hanchen David, et al.
Pubblicazione: (2026)
di: Wang, Hanchen David, et al.
Pubblicazione: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
di: Tian, Shulin, et al.
Pubblicazione: (2025)
di: Tian, Shulin, et al.
Pubblicazione: (2025)
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
di: Li, Baiqi, et al.
Pubblicazione: (2026)
di: Li, Baiqi, et al.
Pubblicazione: (2026)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning
di: Cheng, Qinchuan, et al.
Pubblicazione: (2026)
di: Cheng, Qinchuan, et al.
Pubblicazione: (2026)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
Diffusing the Blind Spot: Uterine MRI Synthesis with Diffusion Models
di: Müller, Johanna P., et al.
Pubblicazione: (2025)
di: Müller, Johanna P., et al.
Pubblicazione: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation
di: Chu, Qiaohui, et al.
Pubblicazione: (2025)
di: Chu, Qiaohui, et al.
Pubblicazione: (2025)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization
di: Wang, Xiaoqi, et al.
Pubblicazione: (2025)
di: Wang, Xiaoqi, et al.
Pubblicazione: (2025)
Challenges and Trends in Egocentric Vision: A Survey
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition
di: Xie, Kunyuan, et al.
Pubblicazione: (2026) -
DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors
di: Kundu, Kaustubh, et al.
Pubblicazione: (2025) -
EgoBlind: Towards Egocentric Visual Assistance for the Blind
di: Xiao, Junbin, et al.
Pubblicazione: (2025) -
Exploring Audio Hallucination in Egocentric Video Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2026) -
1M-Deepfakes Detection Challenge
di: Cai, Zhixi, et al.
Pubblicazione: (2024)