DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qi, Xuan, He, Luxi, Roth, Dan, Fu, Xingyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FamiCom: Further Demystifying Prompts for Language Models with Task-Agnostic Performance Estimation
par: Li, Bangzheng, et autres
Publié: (2024)
par: Li, Bangzheng, et autres
Publié: (2024)
What is in Your Safe Data? Identifying Benign Data that Breaks Safety
par: He, Luxi, et autres
Publié: (2024)
par: He, Luxi, et autres
Publié: (2024)
Conflicts in Texts: Data, Implications and Challenges
par: Liu, Siyi, et autres
Publié: (2025)
par: Liu, Siyi, et autres
Publié: (2025)
Demystifying CLIP Data
par: Xu, Hu, et autres
Publié: (2023)
par: Xu, Hu, et autres
Publié: (2023)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
Influential Training Data Retrieval for Explaining Verbalized Confidence of LLMs
par: Xia, Yuxi, et autres
Publié: (2026)
par: Xia, Yuxi, et autres
Publié: (2026)
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
par: Fu, Xingyu, et autres
Publié: (2025)
par: Fu, Xingyu, et autres
Publié: (2025)
Demystifying Domain-adaptive Post-training for Financial LLMs
par: Ke, Zixuan, et autres
Publié: (2025)
par: Ke, Zixuan, et autres
Publié: (2025)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
par: Hu, Yushi, et autres
Publié: (2024)
par: Hu, Yushi, et autres
Publié: (2024)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
par: Fu, Xingyu, et autres
Publié: (2023)
par: Fu, Xingyu, et autres
Publié: (2023)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
On the Calibration of Multilingual Question Answering LLMs
par: Yang, Yahan, et autres
Publié: (2023)
par: Yang, Yahan, et autres
Publié: (2023)
Multimodal Misinformation Detection by Learning from Synthetic Data with Multimodal LLMs
par: Zeng, Fengzhu, et autres
Publié: (2024)
par: Zeng, Fengzhu, et autres
Publié: (2024)
Demystifying Long Chain-of-Thought Reasoning in LLMs
par: Yeo, Edward, et autres
Publié: (2025)
par: Yeo, Edward, et autres
Publié: (2025)
Demystifying When Pruning Works via Representation Hierarchies
par: He, Shwai, et autres
Publié: (2026)
par: He, Shwai, et autres
Publié: (2026)
Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
par: Li, Alan, et autres
Publié: (2025)
par: Li, Alan, et autres
Publié: (2025)
UEval: A Benchmark for Unified Multimodal Generation
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
par: Li, Bangzheng, et autres
Publié: (2023)
par: Li, Bangzheng, et autres
Publié: (2023)
Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark Approach
par: Li, Xingyu, et autres
Publié: (2025)
par: Li, Xingyu, et autres
Publié: (2025)
Can LLMs Narrate Tabular Data? An Evaluation Framework for Natural Language Representations of Text-to-SQL System Outputs
par: Singh, Jyotika, et autres
Publié: (2025)
par: Singh, Jyotika, et autres
Publié: (2025)
OPDAI at SemEval-2024 Task 6: Small LLMs can Accelerate Hallucination Detection with Weakly Supervised Data
par: Wei, Chengcheng, et autres
Publié: (2024)
par: Wei, Chengcheng, et autres
Publié: (2024)
CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
Arctic-SnowCoder: Demystifying High-Quality Data in Code Pretraining
par: Wei, Yuxiang, et autres
Publié: (2024)
par: Wei, Yuxiang, et autres
Publié: (2024)
LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
par: Yang, Qingchuan, et autres
Publié: (2025)
par: Yang, Qingchuan, et autres
Publié: (2025)
GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation
par: Chen, Zihong, et autres
Publié: (2025)
par: Chen, Zihong, et autres
Publié: (2025)
AIDE: Attribute-Guided MultI-Hop Data Expansion for Data Scarcity in Task-Specific Fine-tuning
par: Li, Jiayu, et autres
Publié: (2024)
par: Li, Jiayu, et autres
Publié: (2024)
Evaluating LLMs' Mathematical Reasoning in Financial Document Question Answering
par: Srivastava, Pragya, et autres
Publié: (2024)
par: Srivastava, Pragya, et autres
Publié: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
par: Huang, Jianuo, et autres
Publié: (2025)
par: Huang, Jianuo, et autres
Publié: (2025)
From Measurement Instruments to Data: Leveraging Theory-Driven Synthetic Training Data for Classifying Social Constructs
par: Birkenmaier, Lukas, et autres
Publié: (2024)
par: Birkenmaier, Lukas, et autres
Publié: (2024)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Data-efficient LLM Fine-tuning for Code Generation
par: Lv, Weijie, et autres
Publié: (2025)
par: Lv, Weijie, et autres
Publié: (2025)
LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking
par: Wu, Junhong, et autres
Publié: (2025)
par: Wu, Junhong, et autres
Publié: (2025)
SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation
par: He, Hangfeng, et autres
Publié: (2023)
par: He, Hangfeng, et autres
Publié: (2023)
Ziya2: Data-centric Learning is All LLMs Need
par: Gan, Ruyi, et autres
Publié: (2023)
par: Gan, Ruyi, et autres
Publié: (2023)
Reasoning is about giving reasons
par: Shah, Krunal, et autres
Publié: (2025)
par: Shah, Krunal, et autres
Publié: (2025)
Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions
par: Hee, Ming Shan, et autres
Publié: (2025)
par: Hee, Ming Shan, et autres
Publié: (2025)
Unveiling Divergent Inductive Biases of LLMs on Temporal Data
par: Kishore, Sindhu, et autres
Publié: (2024)
par: Kishore, Sindhu, et autres
Publié: (2024)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
par: Lu, Yuxiao, et autres
Publié: (2024)
par: Lu, Yuxiao, et autres
Publié: (2024)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
par: Rallapalli, Swati, et autres
Publié: (2025)
par: Rallapalli, Swati, et autres
Publié: (2025)
Documents similaires
-
FamiCom: Further Demystifying Prompts for Language Models with Task-Agnostic Performance Estimation
par: Li, Bangzheng, et autres
Publié: (2024) -
What is in Your Safe Data? Identifying Benign Data that Breaks Safety
par: He, Luxi, et autres
Publié: (2024) -
Conflicts in Texts: Data, Implications and Challenges
par: Liu, Siyi, et autres
Publié: (2025) -
Demystifying CLIP Data
par: Xu, Hu, et autres
Publié: (2023) -
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
par: Fu, Xingyu, et autres
Publié: (2024)