Multimodal Event Detection: Current Approaches and Defining the New Playground through LLMs and VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dey, Abhishek, Bothera, Aabha, Sarikonda, Samhita, Aryan, Rishav, Podishetty, Sanjay Kumar, Havalgi, Akshay, Singh, Gaurav, Srivastava, Saurabh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Multimodal Fusion Framework for Bridge Defect Detection with Cross-Verification
par: Rachuri, Ravi Datta, et autres
Publié: (2024)
par: Rachuri, Ravi Datta, et autres
Publié: (2024)
Instruction-Tuning LLMs for Event Extraction with Annotation Guidelines
par: Srivastava, Saurabh, et autres
Publié: (2025)
par: Srivastava, Saurabh, et autres
Publié: (2025)
Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction
par: Srivastava, Saurabh, et autres
Publié: (2025)
par: Srivastava, Saurabh, et autres
Publié: (2025)
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
Towards Efficient Exemplar Based Image Editing with Multimodal VLMs
par: Jadhav, Avadhoot, et autres
Publié: (2025)
par: Jadhav, Avadhoot, et autres
Publié: (2025)
Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
par: Srivastava, Saurabh, et autres
Publié: (2025)
par: Srivastava, Saurabh, et autres
Publié: (2025)
Real-Time Performance Benchmarking of TinyML Models in Embedded Systems (PICO: Performance of Inference, CPU, and Operations)
par: Dey, Abhishek, et autres
Publié: (2025)
par: Dey, Abhishek, et autres
Publié: (2025)
RoboPlayground: Democratizing Robotic Evaluation through Structured Physical Domains
par: Wang, Yi Ru, et autres
Publié: (2026)
par: Wang, Yi Ru, et autres
Publié: (2026)
OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning
par: Srivastava, Siddharth, et autres
Publié: (2025)
par: Srivastava, Siddharth, et autres
Publié: (2025)
LLMs as Debate Partners: Utilizing Genetic Algorithms and Adversarial Search for Adaptive Arguments
par: Aryan, Prakash
Publié: (2024)
par: Aryan, Prakash
Publié: (2024)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
par: Liu, Zhiwei, et autres
Publié: (2025)
par: Liu, Zhiwei, et autres
Publié: (2025)
Are VLMs Really Blind
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity
par: Bollepally, Samhita, et autres
Publié: (2026)
par: Bollepally, Samhita, et autres
Publié: (2026)
Some variation of COBRA in sequential learning setup
par: Bhambu, Aryan, et autres
Publié: (2024)
par: Bhambu, Aryan, et autres
Publié: (2024)
Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
Can They Dixit? Yes they Can! Dixit as a Playground for Multimodal Language Model Capabilities
par: Balepur, Nishant, et autres
Publié: (2025)
par: Balepur, Nishant, et autres
Publié: (2025)
Instances Need More Care: Rewriting Prompts for Instances with LLMs in the Loop Yields Better Zero-Shot Performance
par: Srivastava, Saurabh, et autres
Publié: (2023)
par: Srivastava, Saurabh, et autres
Publié: (2023)
Towards Recommender Systems LLMs Playground (RecSysLLMsP): Exploring Polarization and Engagement in Simulated Social Networks
par: Bojic, Ljubisa, et autres
Publié: (2025)
par: Bojic, Ljubisa, et autres
Publié: (2025)
FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection
par: Bhaskar, Paramananda, et autres
Publié: (2026)
par: Bhaskar, Paramananda, et autres
Publié: (2026)
Recursive Think-Answer Process for LLMs and VLMs
par: Lee, Byung-Kwan, et autres
Publié: (2026)
par: Lee, Byung-Kwan, et autres
Publié: (2026)
AI Based Font Pair Suggestion Modelling For Graphic Design
par: Singh, Aryan, et autres
Publié: (2025)
par: Singh, Aryan, et autres
Publié: (2025)
On VLMs for Diverse Tasks in Multimodal Meme Classification
par: Gavit, Deepesh, et autres
Publié: (2025)
par: Gavit, Deepesh, et autres
Publié: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
par: Lu, Meng, et autres
Publié: (2025)
par: Lu, Meng, et autres
Publié: (2025)
BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs
par: Baranwal, Aaditya, et autres
Publié: (2026)
par: Baranwal, Aaditya, et autres
Publié: (2026)
Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs
par: Carbune, Victor, et autres
Publié: (2024)
par: Carbune, Victor, et autres
Publié: (2024)
NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews
par: Spangher, Alexander, et autres
Publié: (2024)
par: Spangher, Alexander, et autres
Publié: (2024)
Comparative Analysis of Vision Transformers and Traditional Deep Learning Approaches for Automated Pneumonia Detection in Chest X-Rays
par: Singh, Gaurav
Publié: (2025)
par: Singh, Gaurav
Publié: (2025)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI
par: Singh, Saurabh K., et autres
Publié: (2026)
par: Singh, Saurabh K., et autres
Publié: (2026)
T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground
par: Stoianov, Dmitrii, et autres
Publié: (2025)
par: Stoianov, Dmitrii, et autres
Publié: (2025)
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
par: Dong, Sixun, et autres
Publié: (2025)
par: Dong, Sixun, et autres
Publié: (2025)
Rethinking VLMs and LLMs for Image Classification
par: Cooper, Avi, et autres
Publié: (2024)
par: Cooper, Avi, et autres
Publié: (2024)
A Comprehensive Survey of Bias in LLMs: Current Landscape and Future Directions
par: Ranjan, Rajesh, et autres
Publié: (2024)
par: Ranjan, Rajesh, et autres
Publié: (2024)
Uncertainty-Aware Dual-Student Knowledge Distillation for Efficient Image Classification
par: Gore, Aakash, et autres
Publié: (2025)
par: Gore, Aakash, et autres
Publié: (2025)
Spelling Correction in Healthcare Query-Answer Systems: Methods, Retrieval Impact, and Empirical Evaluation
par: Singh, Saurabh K
Publié: (2026)
par: Singh, Saurabh K
Publié: (2026)
For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs
par: Deng, Wenlong, et autres
Publié: (2025)
par: Deng, Wenlong, et autres
Publié: (2025)
Enhancing Decision-Making in Optimization through LLM-Assisted Inference: A Neural Networks Perspective
par: Singh, Gaurav, et autres
Publié: (2024)
par: Singh, Gaurav, et autres
Publié: (2024)
Software-Defined Agentic Serving
par: Agarwal, Saurabh, et autres
Publié: (2026)
par: Agarwal, Saurabh, et autres
Publié: (2026)
GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
par: Nguyen, Duy, et autres
Publié: (2025)
par: Nguyen, Duy, et autres
Publié: (2025)
Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables
par: Singh, Anshul, et autres
Publié: (2025)
par: Singh, Anshul, et autres
Publié: (2025)
Documents similaires
-
A Multimodal Fusion Framework for Bridge Defect Detection with Cross-Verification
par: Rachuri, Ravi Datta, et autres
Publié: (2024) -
Instruction-Tuning LLMs for Event Extraction with Annotation Guidelines
par: Srivastava, Saurabh, et autres
Publié: (2025) -
Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction
par: Srivastava, Saurabh, et autres
Publié: (2025) -
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024) -
Towards Efficient Exemplar Based Image Editing with Multimodal VLMs
par: Jadhav, Avadhoot, et autres
Publié: (2025)