VATSA: Video, Audio, Text, Sensory, Action - A Unified Five-Modality Architecture for Human-Level Perception and Action
Fuente:
Zenodo
Guardado en:
| Autor principal: | K V (Kengeri Vijaya Kumar), Vinay Kumar |
|---|---|
| Formato: | Recurso digital |
| Lenguaje: | inglés |
| Publicado: |
Zenodo
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Multimodal Mood Classification Framework for Hindi Songs
por: Braja Gopal Patra
Publicado: (2016)
por: Braja Gopal Patra
Publicado: (2016)
whisply: Cross-Platform Python App for Batch Transcription, Translation, Speaker Annotation and Subtitle Generation of Video and Audio Content
por: Schmidt, Thomas
Publicado: (2026)
por: Schmidt, Thomas
Publicado: (2026)
Lack of standards in evaluating YouTube health videos
por: Juan-José Boté
Publicado: (2019)
por: Juan-José Boté
Publicado: (2019)
READING BEHAVIOR OF DIGITAL MULTIMODAL TEXTS IN PRIMARY SCHOOL
por: Gerzon Yair Calle-Alvarez
Publicado: (2020)
por: Gerzon Yair Calle-Alvarez
Publicado: (2020)
Ep. 939: The Physics of Peace: Managing Parental Sensory Overload
por: Rosehill, Daniel, et al.
Publicado: (2026)
por: Rosehill, Daniel, et al.
Publicado: (2026)
Students’ beliefs: Multimodal texts as pedagogical tools in foreign language learning
por: David Leonardo García León
Publicado: (2011)
por: David Leonardo García León
Publicado: (2011)
VYTEDU: Un corpus de vídeos y sus transcripciones para investigación en el ámbito educativo
por: Jenny Alexandra Ortiz Zambrano
Publicado: (2017)
por: Jenny Alexandra Ortiz Zambrano
Publicado: (2017)
REAL-AI-Benchmark: Real-World Reasoning and Physical-AI Benchmark Suite
por: Ivković, Jovan
Publicado: (2026)
por: Ivković, Jovan
Publicado: (2026)
The Benefits of the Video Abstract as a Newly Emerging Academic Genre.
por: Lucas Accastello
Publicado: (2023)
por: Lucas Accastello
Publicado: (2023)
Using Genre Analysis to Detect AI-Generated Academic Texts
por: Mimoun Melliti
Publicado: (2024)
por: Mimoun Melliti
Publicado: (2024)
Prior Art: Autonomous Scenario-to-Video Generation System With Continuity (Clip Machine)
por: Ochej, Stéphane
Publicado: (2026)
por: Ochej, Stéphane
Publicado: (2026)
A new paradigm of interaction for human controlled technical systems
por: R. Möller
Publicado: (2006)
por: R. Möller
Publicado: (2006)
Reading with eyes wide open: reflections on the impact of multimodal texts in second language reading
por: Paul Abraham
Publicado: (2017)
por: Paul Abraham
Publicado: (2017)
Ep. 911: Sound as a Shield: Reclaiming Calm in High-Stress Zones
por: Rosehill, Daniel, et al.
Publicado: (2026)
por: Rosehill, Daniel, et al.
Publicado: (2026)
Human-in-the-Loop at the Commit Point: Architectural Patterns for Trustworthy Agentic AI Deployment in Enterprise Scheduling
por: Lal, Raj
Publicado: (2026)
por: Lal, Raj
Publicado: (2026)
GeoClimate-FusionLLM: Explainable Multi-Modal Environmental Early-Warning Pipeline
por: Ahmed, Shaheen Mohammed Saleh, et al.
Publicado: (2026)
por: Ahmed, Shaheen Mohammed Saleh, et al.
Publicado: (2026)
The Evolution of Audio Processing: Technological and Digital Mediation in Music Creation and Record Production
por: Jorge Mario Valencia Upegui
Publicado: (2023)
por: Jorge Mario Valencia Upegui
Publicado: (2023)
WORKING AT THE CROSSROADS OF STRUCTURATIONIST AND DISCURSIVE APPROACHES: A METHODOLOGICAL TOOL FOR PRACTICE-BASED STUDIES
por: Marlei Pozzebon
Publicado: (2021)
por: Marlei Pozzebon
Publicado: (2021)
SoundFlow: A high-performance, secure audio and MIDI engine for .NET
por: Abdallah, Ahmed
Publicado: (2026)
por: Abdallah, Ahmed
Publicado: (2026)
Accesibilidad a los contenidos educativos audiovisuales: nuevas tecnologías con formatos contenedores
por: Covadonga Rodrigo San Juan
Publicado: (2010)
por: Covadonga Rodrigo San Juan
Publicado: (2010)
Comparación de marcas de agua y huellas de audio como técnicas para la identificación de pautas comerciales
por: Daniel Alejandro Arango Parrado
Publicado: (2008)
por: Daniel Alejandro Arango Parrado
Publicado: (2008)
Multimodal Learning Reveals Plants' Hidden Sensory Integration Logic
por: VOMO DONFACK, Kelly Larissa, et al.
Publicado: (2025)
por: VOMO DONFACK, Kelly Larissa, et al.
Publicado: (2025)
AI Detection Report: 2024 International Songwriting Competition: Evidence of undisclosed and undetected AI-generated songs receiving awards despite prohibition, undermining fair competition for songwriters
por: Stanek, Joseph
Publicado: (2026)
por: Stanek, Joseph
Publicado: (2026)
International Journal of Advances in Telecommunications, Electrotechnics, Signals and Systems
Publicado: (2013)
Publicado: (2013)
Función resumen perceptual para verificación de integridad en audio forense
por: Dora M. Ballesteros L.
Publicado: (2017)
por: Dora M. Ballesteros L.
Publicado: (2017)
Anti-illusionist Trend in Drama Translation: Re-framing Jiří Levý’s Concept
por: Iryna Odrekhivska
Publicado: (2016)
por: Iryna Odrekhivska
Publicado: (2016)
Does ChatGPT Scrape Video Essays - Venkman in 4:3
por: Donnelly, Cormac
Publicado: (2025)
por: Donnelly, Cormac
Publicado: (2025)
AI Text vs. Human Writing: A Machine Learning-Based Detection Approach
por: D Vasantha
Publicado: (2025)
por: D Vasantha
Publicado: (2025)
Recognizing the Unseen: A Verified, Multimodal Framework for Trauma-Informed AI
por: George, Michelle Lynn
Publicado: (2025)
por: George, Michelle Lynn
Publicado: (2025)
Automated ESG Prediction through Artificial Intelligence: A Literature-Driven Empirical Synthesis and Framework for Future Research
por: Aditya Prakash, et al.
Publicado: (2025)
por: Aditya Prakash, et al.
Publicado: (2025)
Modeling Multimodal Multitasking in a Smart House
por: Pilar Manchón
Publicado: (2009)
por: Pilar Manchón
Publicado: (2009)
HK Web Text Corpus (MySQL Dump, raw version)
por: Yung, Yiu Cheong
Publicado: (2025)
por: Yung, Yiu Cheong
Publicado: (2025)
EURASIP Journal on Audio, Speech, and Music Processing
Publicado: (2006)
Publicado: (2006)
Diseño del subsistema de edición de audio para el proyecto captura y catalogación de medias
por: Annies Cedeño López
Publicado: (2011)
por: Annies Cedeño López
Publicado: (2011)
Ep. 285: Hidden in Plain Sight: The Engineering of Modern Spy Gear
por: Rosehill, Daniel, et al.
Publicado: (2026)
por: Rosehill, Daniel, et al.
Publicado: (2026)
Audiovisual Examples for "Spatial Articulation in Musical Notation: A Perceptual Approach"
por: Valverde Vilabella, Angel
Publicado: (2026)
por: Valverde Vilabella, Angel
Publicado: (2026)
Silent Misalignment in Multimodal Generative System: A Trace-Based Analysis of Cross-Turn State Drift in Text–Image Workflows
por: Ma, Sincere Ann
Publicado: (2026)
por: Ma, Sincere Ann
Publicado: (2026)
Alta fidelidad: magnetófonos a cassette / editor, José Mompin Poblet
A viable wireless PC assisted alternative to studies of vectorcardiography
por: Juan Carlos Estrada-Gutiérrez
Publicado: (2015)
por: Juan Carlos Estrada-Gutiérrez
Publicado: (2015)
Ejemplares similares
-
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025) -
Multimodal Mood Classification Framework for Hindi Songs
por: Braja Gopal Patra
Publicado: (2016) -
whisply: Cross-Platform Python App for Batch Transcription, Translation, Speaker Annotation and Subtitle Generation of Video and Audio Content
por: Schmidt, Thomas
Publicado: (2026) -
Lack of standards in evaluating YouTube health videos
por: Juan-José Boté
Publicado: (2019) -
READING BEHAVIOR OF DIGITAL MULTIMODAL TEXTS IN PRIMARY SCHOOL
por: Gerzon Yair Calle-Alvarez
Publicado: (2020)