Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yifei, Xu, Jilan, Pei, Baoqi, He, Yuping, Chen, Guo, Yang, Lijin, Chen, Xinyuan, Wang, Yaohui, Nie, Zheng, Liu, Jinyao, Fan, Guoshun, Lin, Dechen, Fang, Fang, Li, Kunpeng, Yuan, Chang, Wang, Yali, Qiao, Yu, Wang, Limin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Egocentric Vision-Language Model based Portable Real-time Smart Assistant
di: Huang, Yifei, et al.
Pubblicazione: (2025)
di: Huang, Yifei, et al.
Pubblicazione: (2025)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
di: Huang, Yifei, et al.
Pubblicazione: (2024)
di: Huang, Yifei, et al.
Pubblicazione: (2024)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
Vlogger: Make Your Dream A Vlog
di: Zhuang, Shaobin, et al.
Pubblicazione: (2024)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2024)
ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
Retrieval-Augmented Egocentric Video Captioning
di: Xu, Jilan, et al.
Pubblicazione: (2024)
di: Xu, Jilan, et al.
Pubblicazione: (2024)
Cinemo: Consistent and Controllable Image Animation with Motion Diffusion Models
di: Ma, Xin, et al.
Pubblicazione: (2024)
di: Ma, Xin, et al.
Pubblicazione: (2024)
Non-uniform Point Cloud Upsampling via Local Manifold Distribution
di: Fang, Yaohui, et al.
Pubblicazione: (2025)
di: Fang, Yaohui, et al.
Pubblicazione: (2025)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
di: Peng, Bo, et al.
Pubblicazione: (2023)
di: Peng, Bo, et al.
Pubblicazione: (2023)
CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
Delineation of Fallow Priority Areas Under Food Security Constraints Using the MARXAN
di: Qitong Chen, et al.
Pubblicazione: (2025)
di: Qitong Chen, et al.
Pubblicazione: (2025)
EgoSelf: From Memory to Personalized Egocentric Assistant
di: Wang, Yanshuo, et al.
Pubblicazione: (2026)
di: Wang, Yanshuo, et al.
Pubblicazione: (2026)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
di: Zhang, Haiyu, et al.
Pubblicazione: (2025)
di: Zhang, Haiyu, et al.
Pubblicazione: (2025)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
di: Xu, Jilan, et al.
Pubblicazione: (2025)
di: Xu, Jilan, et al.
Pubblicazione: (2025)
Latte: Latent Diffusion Transformer for Video Generation
di: Ma, Xin, et al.
Pubblicazione: (2024)
di: Ma, Xin, et al.
Pubblicazione: (2024)
Amortized Clustering Assistant Classification of Anomalous Hybrid Floquet Modes in a Periodically Driven non-Hermitian Lattice
di: Xia, Yifei, et al.
Pubblicazione: (2025)
di: Xia, Yifei, et al.
Pubblicazione: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
di: Yan, Jiaqi, et al.
Pubblicazione: (2025)
di: Yan, Jiaqi, et al.
Pubblicazione: (2025)
PARE: Pruning and Adaptive Routing for Efficient Video Generation
di: Wang, Yutong, et al.
Pubblicazione: (2026)
di: Wang, Yutong, et al.
Pubblicazione: (2026)
LIA-X: Interpretable Latent Portrait Animator
di: Wang, Yaohui, et al.
Pubblicazione: (2025)
di: Wang, Yaohui, et al.
Pubblicazione: (2025)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
di: Wang, Zikang, et al.
Pubblicazione: (2025)
di: Wang, Zikang, et al.
Pubblicazione: (2025)
VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
di: Wang, Yutong, et al.
Pubblicazione: (2025)
di: Wang, Yutong, et al.
Pubblicazione: (2025)
Proactive Hearing Assistants that Isolate Egocentric Conversations
di: Hu, Guilin, et al.
Pubblicazione: (2025)
di: Hu, Guilin, et al.
Pubblicazione: (2025)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
LEO: Generative Latent Image Animator for Human Video Synthesis
di: Wang, Yaohui, et al.
Pubblicazione: (2023)
di: Wang, Yaohui, et al.
Pubblicazione: (2023)
TimeStep Master: Asymmetrical Mixture of Timestep LoRA Experts for Versatile and Efficient Diffusion Models in Vision
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
EgoLife: Towards Egocentric Life Assistant
di: Yang, Jingkang, et al.
Pubblicazione: (2025)
di: Yang, Jingkang, et al.
Pubblicazione: (2025)
SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting
di: Liu, Ruicong, et al.
Pubblicazione: (2025)
di: Liu, Ruicong, et al.
Pubblicazione: (2025)
Training-free Stylized Text-to-Image Generation with Fast Inference
di: Ma, Xin, et al.
Pubblicazione: (2025)
di: Ma, Xin, et al.
Pubblicazione: (2025)
Low-Resolution Action Recognition for Tiny Actions Challenge
di: Chen, Boyu, et al.
Pubblicazione: (2022)
di: Chen, Boyu, et al.
Pubblicazione: (2022)
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
An Egocentric Vision-Language Model based Portable Real-time Smart Assistant
di: Huang, Yifei, et al.
Pubblicazione: (2025) -
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025) -
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024) -
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
di: Huang, Yifei, et al.
Pubblicazione: (2024) -
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)