AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Suglia, Alessandro, Greco, Claudio, Baker, Katie, Part, Jose L., Papaioannou, Ioannis, Eshghi, Arash, Konstas, Ioannis, Lemon, Oliver |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
par: Mehrafarin, Houman, et autres
Publié: (2024)
par: Mehrafarin, Houman, et autres
Publié: (2024)
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
par: Nikandrou, Malvina, et autres
Publié: (2024)
par: Nikandrou, Malvina, et autres
Publié: (2024)
Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation Tasks
par: Parekh, Amit, et autres
Publié: (2024)
par: Parekh, Amit, et autres
Publié: (2024)
Building for Speech: Designing the Next Generation of Social Robots for Audio Interaction
par: Addlesee, Angus, et autres
Publié: (2023)
par: Addlesee, Angus, et autres
Publié: (2023)
Repairs in a Block World: A New Benchmark for Handling User Corrections with Multi-Modal Language Models
par: Chiyah-Garcia, Javier, et autres
Publié: (2024)
par: Chiyah-Garcia, Javier, et autres
Publié: (2024)
CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts
par: Nikandrou, Malvina, et autres
Publié: (2024)
par: Nikandrou, Malvina, et autres
Publié: (2024)
Retrievit: In-context Retrieval Capabilities of Transformers, State Space Models, and Hybrid Architectures
par: Pantazopoulos, Georgios, et autres
Publié: (2026)
par: Pantazopoulos, Georgios, et autres
Publié: (2026)
Voices in a Crowd: Searching for Clusters of Unique Perspectives
par: Vitsakis, Nikolas, et autres
Publié: (2024)
par: Vitsakis, Nikolas, et autres
Publié: (2024)
When Chain-of-Thought Fails, the Solution Hides in the Hidden States
par: Mehrafarin, Houman, et autres
Publié: (2026)
par: Mehrafarin, Houman, et autres
Publié: (2026)
Task Formulation Matters When Learning Continually: A Case Study in Visual Question Answering
par: Nikandrou, Mavina, et autres
Publié: (2022)
par: Nikandrou, Mavina, et autres
Publié: (2022)
Erasing 'Ugly' from the Internet: Propagation of the Beauty Myth in Text-Image Models
par: Dinkar, Tanvi, et autres
Publié: (2025)
par: Dinkar, Tanvi, et autres
Publié: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
par: Cheng, Sijie, et autres
Publié: (2024)
par: Cheng, Sijie, et autres
Publié: (2024)
MoRFI: Monotonic Sparse Autoencoder Feature Identification
par: Dimakopoulos, Dimitris, et autres
Publié: (2026)
par: Dimakopoulos, Dimitris, et autres
Publié: (2026)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026)
par: Saxena, Rohit, et autres
Publié: (2026)
EgoVLM: Policy Optimization for Egocentric Video Understanding
par: Vinod, Ashwin, et autres
Publié: (2025)
par: Vinod, Ashwin, et autres
Publié: (2025)
FOSSIL: Harnessing Feedback on Suboptimal Samples for Data-Efficient Generalisation with Imitation Learning for Embodied Vision-and-Language Tasks
par: McCallum, Sabrina, et autres
Publié: (2025)
par: McCallum, Sabrina, et autres
Publié: (2025)
Re-examining Sexism and Misogyny Classification with Annotator Attitudes
par: Jiang, Aiqi, et autres
Publié: (2024)
par: Jiang, Aiqi, et autres
Publié: (2024)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
par: Fan, Yue, et autres
Publié: (2024)
par: Fan, Yue, et autres
Publié: (2024)
AoE: Always-on Egocentric Human Video Collection for Embodied AI
par: Yang, Bowen, et autres
Publié: (2026)
par: Yang, Bowen, et autres
Publié: (2026)
Lower Bounds for Subset Sum in Resolution with Modular Counting
par: Part, Fedor
Publié: (2022)
par: Part, Fedor
Publié: (2022)
Six Birds: Foundations of Emergence Calculus
par: Tsiokos, Ioannis
Publié: (2026)
par: Tsiokos, Ioannis
Publié: (2026)
Triangulating LLM Progress through Benchmarks, Games, and Cognitive Tests
par: Momentè, Filippo, et autres
Publié: (2025)
par: Momentè, Filippo, et autres
Publié: (2025)
ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark
par: Dang, Ronghao, et autres
Publié: (2025)
par: Dang, Ronghao, et autres
Publié: (2025)
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025)
par: Pani, Anupam, et autres
Publié: (2025)
Can NLP Tackle Hate Speech in the Real World? Stakeholder-Informed Feedback and Survey on Counterspeech
par: Dinkar, Tanvi, et autres
Publié: (2025)
par: Dinkar, Tanvi, et autres
Publié: (2025)
EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation
par: Leonardi, Rosario, et autres
Publié: (2026)
par: Leonardi, Rosario, et autres
Publié: (2026)
Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions
par: Dong, Ze, et autres
Publié: (2026)
par: Dong, Ze, et autres
Publié: (2026)
EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
par: Lin, Dongyan, et autres
Publié: (2026)
par: Lin, Dongyan, et autres
Publié: (2026)
Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
FoMo: Multi-Modal, Multi-Scale and Multi-Task Remote Sensing Foundation Models for Forest Monitoring
par: Bountos, Nikolaos Ioannis, et autres
Publié: (2023)
par: Bountos, Nikolaos Ioannis, et autres
Publié: (2023)
AgriPath: A Systematic Exploration of Architectural Trade-offs for Crop Disease Classification
par: Mooraj, Hamza, et autres
Publié: (2026)
par: Mooraj, Hamza, et autres
Publié: (2026)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
par: Seth, Ashish, et autres
Publié: (2025)
par: Seth, Ashish, et autres
Publié: (2025)
Exploring Audio Hallucination in Egocentric Video Understanding
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
A Multimodal Social Agent
par: Bikaki, Athina, et autres
Publié: (2024)
par: Bikaki, Athina, et autres
Publié: (2024)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
par: Zhu, Bingwen, et autres
Publié: (2026)
par: Zhu, Bingwen, et autres
Publié: (2026)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
par: Xu, Zhiyang, et autres
Publié: (2026)
par: Xu, Zhiyang, et autres
Publié: (2026)
Deep Learning Algorithms for Early Diagnosis of Acute Lymphoblastic Leukemia
par: Papaioannou, Dimitris, et autres
Publié: (2024)
par: Papaioannou, Dimitris, et autres
Publié: (2024)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
par: Pei, Baoqi, et autres
Publié: (2024)
par: Pei, Baoqi, et autres
Publié: (2024)
Documents similaires
-
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
par: Pantazopoulos, Georgios, et autres
Publié: (2024) -
Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
par: Mehrafarin, Houman, et autres
Publié: (2024) -
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024) -
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
par: Nikandrou, Malvina, et autres
Publié: (2024) -
Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation Tasks
par: Parekh, Amit, et autres
Publié: (2024)