Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mishra, Suyash, Li, Qiang, Patil, Srikanth, Pati, Satyanarayan, Narendra, Baddu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval
par: Mishra, Suyash, et autres
Publié: (2026)
par: Mishra, Suyash, et autres
Publié: (2026)
From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)
par: Mishra, Suyash, et autres
Publié: (2026)
par: Mishra, Suyash, et autres
Publié: (2026)
GenAI Arena: An Open Evaluation Platform for Generative Models
par: Jiang, Dongfu, et autres
Publié: (2024)
par: Jiang, Dongfu, et autres
Publié: (2024)
Face Consistency Benchmark for GenAI Video
par: Podstawski, Michal, et autres
Publié: (2025)
par: Podstawski, Michal, et autres
Publié: (2025)
Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?
par: Xu, Qipan, et autres
Publié: (2025)
par: Xu, Qipan, et autres
Publié: (2025)
Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods
par: Araya-Martinez, Jose Moises, et autres
Publié: (2025)
par: Araya-Martinez, Jose Moises, et autres
Publié: (2025)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
par: Ma, Martin Q., et autres
Publié: (2026)
par: Ma, Martin Q., et autres
Publié: (2026)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
par: Shu, Yan, et autres
Publié: (2024)
par: Shu, Yan, et autres
Publié: (2024)
Enhancing weed detection performance by means of GenAI-based image augmentation
par: Modak, Sourav, et autres
Publié: (2024)
par: Modak, Sourav, et autres
Publié: (2024)
Exploring Model Quantization in GenAI-based Image Inpainting and Detection of Arable Plants
par: Modak, Sourav, et autres
Publié: (2025)
par: Modak, Sourav, et autres
Publié: (2025)
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
par: Cao, Siyu, et autres
Publié: (2026)
par: Cao, Siyu, et autres
Publié: (2026)
GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation
par: Yu, Jinze, et autres
Publié: (2026)
par: Yu, Jinze, et autres
Publié: (2026)
DiffAtlas: GenAI-fying Atlas Segmentation via Image-Mask Diffusion
par: Zhang, Hantao, et autres
Publié: (2025)
par: Zhang, Hantao, et autres
Publié: (2025)
GenAI Mirage: The Impostor Bias and the Deepfake Detection Challenge in the Era of Artificial Illusions
par: Casu, Mirko, et autres
Publié: (2023)
par: Casu, Mirko, et autres
Publié: (2023)
Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition
par: Hu, Xiaodan, et autres
Publié: (2025)
par: Hu, Xiaodan, et autres
Publié: (2025)
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
par: Chen, Haoxing, et autres
Publié: (2024)
par: Chen, Haoxing, et autres
Publié: (2024)
City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs
par: Dalal, Dwip, et autres
Publié: (2025)
par: Dalal, Dwip, et autres
Publié: (2025)
LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
par: Huang, Zhenpeng, et autres
Publié: (2026)
par: Huang, Zhenpeng, et autres
Publié: (2026)
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
par: Kim, Joowon, et autres
Publié: (2026)
par: Kim, Joowon, et autres
Publié: (2026)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
par: Wang, Chenfeng, et autres
Publié: (2026)
par: Wang, Chenfeng, et autres
Publié: (2026)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
par: Yin, Yufei, et autres
Publié: (2025)
par: Yin, Yufei, et autres
Publié: (2025)
Drifting Away from Truth: GenAI-Driven News Diversity Challenges LVLM-Based Misinformation Detection
par: Li, Fanxiao, et autres
Publié: (2025)
par: Li, Fanxiao, et autres
Publié: (2025)
GenAI Confessions: Black-box Membership Inference for Generative Image Models
par: Bohacek, Matyas, et autres
Publié: (2025)
par: Bohacek, Matyas, et autres
Publié: (2025)
Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
par: Sai, Vishnu, et autres
Publié: (2026)
par: Sai, Vishnu, et autres
Publié: (2026)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
par: Song, Xinshuai, et autres
Publié: (2024)
par: Song, Xinshuai, et autres
Publié: (2024)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
par: Chen, Yukang, et autres
Publié: (2024)
par: Chen, Yukang, et autres
Publié: (2024)
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
par: Li, Baiqi, et autres
Publié: (2024)
par: Li, Baiqi, et autres
Publié: (2024)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning
par: Shah, Sahil, et autres
Publié: (2025)
par: Shah, Sahil, et autres
Publié: (2025)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
Not All Similarities Are Created Equal: Leveraging Data-Driven Biases to Inform GenAI Copyright Disputes
par: Hacohen, Uri, et autres
Publié: (2024)
par: Hacohen, Uri, et autres
Publié: (2024)
GAC-KAN: An Ultra-Lightweight GNSS Interference Classifier for GenAI-Powered Consumer Edge Devices
par: Zeng, Zhihan, et autres
Publié: (2026)
par: Zeng, Zhihan, et autres
Publié: (2026)
Infusing Environmental Captions for Long-Form Video Language Grounding
par: Lee, Hyogun, et autres
Publié: (2024)
par: Lee, Hyogun, et autres
Publié: (2024)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
par: Souza, Rafael, et autres
Publié: (2024)
par: Souza, Rafael, et autres
Publié: (2024)
Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
par: Yokoi, Shingo, et autres
Publié: (2025)
par: Yokoi, Shingo, et autres
Publié: (2025)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
par: Wang, Anmin, et autres
Publié: (2026)
par: Wang, Anmin, et autres
Publié: (2026)
AI-Generated Lecture Slides for Improving Slide Element Detection and Retrieval
par: Maniyar, Suyash, et autres
Publié: (2025)
par: Maniyar, Suyash, et autres
Publié: (2025)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
par: Rahman, Amirul, et autres
Publié: (2025)
par: Rahman, Amirul, et autres
Publié: (2025)
Are Pose Estimators Ready for the Open World? STAGE: A GenAI Toolkit for Auditing 3D Human Pose Estimators
par: Kister, Nikita, et autres
Publié: (2024)
par: Kister, Nikita, et autres
Publié: (2024)
Mitigating GenAI-powered Evidence Pollution for Out-of-Context Multimodal Misinformation Detection
par: Yan, Zehong, et autres
Publié: (2025)
par: Yan, Zehong, et autres
Publié: (2025)
Documents similaires
-
Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval
par: Mishra, Suyash, et autres
Publié: (2026) -
From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)
par: Mishra, Suyash, et autres
Publié: (2026) -
GenAI Arena: An Open Evaluation Platform for Generative Models
par: Jiang, Dongfu, et autres
Publié: (2024) -
Face Consistency Benchmark for GenAI Video
par: Podstawski, Michal, et autres
Publié: (2025) -
Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?
par: Xu, Qipan, et autres
Publié: (2025)