Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kapuriya, Janak, Shaikh, Anwar, Goel, Arnav, Hira, Medha, Singh, Apoorv, Saraf, Jay, Sanjana, Nauriyal, Vaibhav, Anand, Avinash, Wang, Zhengkui, Shah, Rajiv Ratn |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Advancements in Scientific Controllable Text Generation Methods
par: Goel, Arnav, et autres
Publié: (2023)
par: Goel, Arnav, et autres
Publié: (2023)
MM-PhyQA: Multimodal Physics Question-Answering With Multi-Image CoT Prompting
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering
par: Kapuriya, Janak, et autres
Publié: (2024)
par: Kapuriya, Janak, et autres
Publié: (2024)
Spiritual-LLM : Gita Inspired Mental Health Therapy In the Era of LLMs
par: Kapuriya, Janak, et autres
Publié: (2025)
par: Kapuriya, Janak, et autres
Publié: (2025)
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
par: Goel, Arnav, et autres
Publié: (2024)
par: Goel, Arnav, et autres
Publié: (2024)
Exploring Multilingual Unseen Speaker Emotion Recognition: Leveraging Co-Attention Cues in Multitask Learning
par: Goel, Arnav, et autres
Publié: (2024)
par: Goel, Arnav, et autres
Publié: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
par: Hira, Medha, et autres
Publié: (2024)
par: Hira, Medha, et autres
Publié: (2024)
Long-context Non-factoid Question Answering in Indic Languages
par: Mishra, Ritwik, et autres
Publié: (2025)
par: Mishra, Ritwik, et autres
Publié: (2025)
LittiChoQA: Literary Texts in Indic Languages Chosen for Question Answering
par: Khandelwal, Aarya, et autres
Publié: (2026)
par: Khandelwal, Aarya, et autres
Publié: (2026)
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
par: Mishra, Ritwik, et autres
Publié: (2024)
par: Mishra, Ritwik, et autres
Publié: (2024)
Keystroke Dynamics Against Academic Dishonesty in the Age of LLMs
par: Kundu, Debnath, et autres
Publié: (2024)
par: Kundu, Debnath, et autres
Publié: (2024)
Knowledge Graphs are all you need: Leveraging KGs in Physics Question Answering
par: Addala, Krishnasai, et autres
Publié: (2024)
par: Addala, Krishnasai, et autres
Publié: (2024)
Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size
par: Kukreja, Dikshant, et autres
Publié: (2026)
par: Kukreja, Dikshant, et autres
Publié: (2026)
MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation
par: Agarwal, Mehul, et autres
Publié: (2026)
par: Agarwal, Mehul, et autres
Publié: (2026)
KG-CTG: Citation Generation through Knowledge Graph-guided Large Language Models
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
Context-Enhanced Language Models for Generating Multi-Paper Citations
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
RConE: Rough Cone Embedding for Multi-Hop Logical Query Answering on Multi-Modal Knowledge Graphs
par: Kharbanda, Mayank, et autres
Publié: (2024)
par: Kharbanda, Mayank, et autres
Publié: (2024)
Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization
par: Kapuriya, Janak, et autres
Publié: (2025)
par: Kapuriya, Janak, et autres
Publié: (2025)
Depression Detection and Analysis using Large Language Models on Textual and Audio-Visual Modalities
par: Tank, Chayan, et autres
Publié: (2024)
par: Tank, Chayan, et autres
Publié: (2024)
Su-RoBERTa: A Semi-supervised Approach to Predicting Suicide Risk through Social Media using Base Language Models
par: Tank, Chayan, et autres
Publié: (2024)
par: Tank, Chayan, et autres
Publié: (2024)
IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning
par: Gupta, Navya, et autres
Publié: (2026)
par: Gupta, Navya, et autres
Publié: (2026)
Exploring the Role of Diversity in Example Selection for In-Context Learning
par: Kapuriya, Janak, et autres
Publié: (2025)
par: Kapuriya, Janak, et autres
Publié: (2025)
Improving Physics Reasoning in Large Language Models Using Mixture of Refinement Agents
par: Jaiswal, Raj, et autres
Publié: (2024)
par: Jaiswal, Raj, et autres
Publié: (2024)
Med-CoDE: Medical Critique based Disagreement Evaluation Framework
par: Gupta, Mohit, et autres
Publié: (2025)
par: Gupta, Mohit, et autres
Publié: (2025)
Speech Representation Learning Revisited: The Necessity of Separate Learnable Parameters and Robust Data Augmentation
par: Yadav, Hemant, et autres
Publié: (2024)
par: Yadav, Hemant, et autres
Publié: (2024)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
par: Yadav, Hemant, et autres
Publié: (2023)
par: Yadav, Hemant, et autres
Publié: (2023)
MS-HuBERT: Mitigating Pre-training and Inference Mismatch in Masked Language Modelling methods for learning Speech Representations
par: Yadav, Hemant, et autres
Publié: (2024)
par: Yadav, Hemant, et autres
Publié: (2024)
JOOCI: a Framework for Learning Comprehensive Speech Representations
par: Yadav, Hemant, et autres
Publié: (2024)
par: Yadav, Hemant, et autres
Publié: (2024)
Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
Steps are all you need: Rethinking STEM Education with Prompt Engineering
par: Addala, Krishnasai, et autres
Publié: (2024)
par: Addala, Krishnasai, et autres
Publié: (2024)
LLMGuard: Guarding Against Unsafe LLM Behavior
par: Goyal, Shubh, et autres
Publié: (2024)
par: Goyal, Shubh, et autres
Publié: (2024)
Semantic Frame Aggregation-based Transformer for Live Video Comment Generation
par: Fatima, Anam, et autres
Publié: (2025)
par: Fatima, Anam, et autres
Publié: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
Multi-hop Question Answering
par: Mavi, Vaibhav, et autres
Publié: (2022)
par: Mavi, Vaibhav, et autres
Publié: (2022)
Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data
par: Khatri, Mann, et autres
Publié: (2025)
par: Khatri, Mann, et autres
Publié: (2025)
Multilingual Coreference Resolution in Low-resource South Asian Languages
par: Mishra, Ritwik, et autres
Publié: (2024)
par: Mishra, Ritwik, et autres
Publié: (2024)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
par: Sahipjohn, Neha, et autres
Publié: (2024)
par: Sahipjohn, Neha, et autres
Publié: (2024)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
Improving Multimodal LLMs Ability In Geometry Problem Solving, Reasoning, And Multistep Scoring
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
Documents similaires
-
Advancements in Scientific Controllable Text Generation Methods
par: Goel, Arnav, et autres
Publié: (2023) -
MM-PhyQA: Multimodal Physics Question-Answering With Multi-Image CoT Prompting
par: Anand, Avinash, et autres
Publié: (2024) -
MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering
par: Kapuriya, Janak, et autres
Publié: (2024) -
Spiritual-LLM : Gita Inspired Mental Health Therapy In the Era of LLMs
par: Kapuriya, Janak, et autres
Publié: (2025) -
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
par: Goel, Arnav, et autres
Publié: (2024)