EgoBlind: Towards Egocentric Visual Assistance for the Blind
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Junbin, Huang, Nanxin, Qiu, Hao, Tao, Zhulin, Yang, Xun, Hong, Richang, Wang, Meng, Yao, Angela |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
EgoForge: Goal-Directed Egocentric World Simulator
par: Shen, Yifan, et autres
Publié: (2026)
par: Shen, Yifan, et autres
Publié: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)
par: Xiao, Junbin, et autres
Publié: (2023)
Question-Answering Dense Video Events
par: Qin, Hangyu, et autres
Publié: (2024)
par: Qin, Hangyu, et autres
Publié: (2024)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
par: Qian, Xinyuan, et autres
Publié: (2026)
par: Qian, Xinyuan, et autres
Publié: (2026)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026)
par: Ma, Jianzhe, et autres
Publié: (2026)
Deep Shape-Texture Statistics for Completely Blind Image Quality Evaluation
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024)
par: Rai, Aashish, et autres
Publié: (2024)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
par: Hao, Shengyu, et autres
Publié: (2024)
par: Hao, Shengyu, et autres
Publié: (2024)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
Towards Blind Bitstream-corrupted Video Recovery via a Visual Foundation Model-driven Framework
par: Liu, Tianyi, et autres
Publié: (2025)
par: Liu, Tianyi, et autres
Publié: (2025)
TuningIQA: Fine-Grained Blind Image Quality Assessment for Livestreaming Camera Tuning
par: Sheng, Xiangfei, et autres
Publié: (2025)
par: Sheng, Xiangfei, et autres
Publié: (2025)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
par: Wang, Xu, et autres
Publié: (2024)
par: Wang, Xu, et autres
Publié: (2024)
Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
par: Tang, Shengeng, et autres
Publié: (2024)
par: Tang, Shengeng, et autres
Publié: (2024)
VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
Blind Deep-Learning-Based Image Watermarking Robust Against Geometric Transformations
par: Mareen, Hannes, et autres
Publié: (2024)
par: Mareen, Hannes, et autres
Publié: (2024)
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
par: Li, Jie, et autres
Publié: (2023)
par: Li, Jie, et autres
Publié: (2023)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
PRVR: Partially Relevant Video Retrieval
par: Chen, Xianke, et autres
Publié: (2022)
par: Chen, Xianke, et autres
Publié: (2022)
Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
par: Zhang, Dongxu, et autres
Publié: (2026)
par: Zhang, Dongxu, et autres
Publié: (2026)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
Enhancing Blind Video Quality Assessment with Rich Quality-aware Features
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
Opinion-Unaware Blind Image Quality Assessment using Multi-Scale Deep Feature Statistics
par: Ni, Zhangkai, et autres
Publié: (2024)
par: Ni, Zhangkai, et autres
Publié: (2024)
InstructHumans: Editing Animated 3D Human Textures with Instructions
par: Zhu, Jiayin, et autres
Publié: (2024)
par: Zhu, Jiayin, et autres
Publié: (2024)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
par: Wan, Siqi, et autres
Publié: (2025)
par: Wan, Siqi, et autres
Publié: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
par: Yao, Ziyu, et autres
Publié: (2024)
par: Yao, Ziyu, et autres
Publié: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
par: Zhang, Zhongwei, et autres
Publié: (2024)
par: Zhang, Zhongwei, et autres
Publié: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
par: Mao, Qingyang, et autres
Publié: (2025)
par: Mao, Qingyang, et autres
Publié: (2025)
FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
par: Luo, Yang, et autres
Publié: (2024)
par: Luo, Yang, et autres
Publié: (2024)
Beyond Alignment: Blind Video Face Restoration via Parsing-Guided Temporal-Coherent Transformer
par: Xu, Kepeng, et autres
Publié: (2024)
par: Xu, Kepeng, et autres
Publié: (2024)
DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
par: Zou, Jiayi, et autres
Publié: (2025)
par: Zou, Jiayi, et autres
Publié: (2025)
Towards Flexible Evaluation for Generative Visual Question Answering
par: Ji, Huishan, et autres
Publié: (2024)
par: Ji, Huishan, et autres
Publié: (2024)
Documents similaires
-
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025) -
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026) -
EgoForge: Goal-Directed Egocentric World Simulator
par: Shen, Yifan, et autres
Publié: (2026) -
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024) -
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)