Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Gkoumas, Dimitris, Liakata, Maria |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ALMol: Aligned Language-Molecule Translation LLMs through Offline Preference Contrastive Optimisation
di: Gkoumas, Dimitris
Pubblicazione: (2024)
di: Gkoumas, Dimitris
Pubblicazione: (2024)
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026)
di: Zhu, Haina, et al.
Pubblicazione: (2026)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
di: Zhou, Ziyi, et al.
Pubblicazione: (2024)
di: Zhou, Ziyi, et al.
Pubblicazione: (2024)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
di: Shih, Yu-Fei, et al.
Pubblicazione: (2025)
di: Shih, Yu-Fei, et al.
Pubblicazione: (2025)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
See or Guess: Counterfactually Regularized Image Captioning
di: Cao, Qian, et al.
Pubblicazione: (2024)
di: Cao, Qian, et al.
Pubblicazione: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization
di: Chen, Tao, et al.
Pubblicazione: (2023)
di: Chen, Tao, et al.
Pubblicazione: (2023)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
di: Jin, Zeyu, et al.
Pubblicazione: (2024)
di: Jin, Zeyu, et al.
Pubblicazione: (2024)
Lost in Overlap: Exploring Logit-based Watermark Collision in LLMs
di: Luo, Yiyang, et al.
Pubblicazione: (2024)
di: Luo, Yiyang, et al.
Pubblicazione: (2024)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Enhancing Multimodal Entity and Relation Extraction with Variational Information Bottleneck
di: Cui, Shiyao, et al.
Pubblicazione: (2023)
di: Cui, Shiyao, et al.
Pubblicazione: (2023)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
di: Chen, Xiaolin, et al.
Pubblicazione: (2025)
di: Chen, Xiaolin, et al.
Pubblicazione: (2025)
FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
di: Sukhani, Siddhant, et al.
Pubblicazione: (2025)
di: Sukhani, Siddhant, et al.
Pubblicazione: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
di: Yan, Qianqi, et al.
Pubblicazione: (2026)
di: Yan, Qianqi, et al.
Pubblicazione: (2026)
Contrast then Memorize: Semantic Neighbor Retrieval-Enhanced Inductive Multimodal Knowledge Graph Completion
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
di: Calbucura, Nicolas, et al.
Pubblicazione: (2025)
di: Calbucura, Nicolas, et al.
Pubblicazione: (2025)
Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet
di: Bagci, Mevlüt, et al.
Pubblicazione: (2025)
di: Bagci, Mevlüt, et al.
Pubblicazione: (2025)
ReactXT: Understanding Molecular "Reaction-ship" via Reaction-Contextualized Molecule-Text Pretraining
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
di: Li, Jia, et al.
Pubblicazione: (2025)
di: Li, Jia, et al.
Pubblicazione: (2025)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Towards Retrieval-Augmented Architectures for Image Captioning
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
di: Zhang, Bo, et al.
Pubblicazione: (2024)
di: Zhang, Bo, et al.
Pubblicazione: (2024)
Text2Sign Diffusion: A Generative Approach for Gloss-Free Sign Language Production
di: Feng, Liqian, et al.
Pubblicazione: (2025)
di: Feng, Liqian, et al.
Pubblicazione: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
di: Xu, David
Pubblicazione: (2024)
di: Xu, David
Pubblicazione: (2024)
Can Prompting LLMs Unlock Hate Speech Detection across Languages? A Zero-shot and Few-shot Study
di: Ghorbanpour, Faeze, et al.
Pubblicazione: (2025)
di: Ghorbanpour, Faeze, et al.
Pubblicazione: (2025)
Cardiverse: Harnessing LLMs for Novel Card Game Prototyping
di: Li, Danrui, et al.
Pubblicazione: (2025)
di: Li, Danrui, et al.
Pubblicazione: (2025)
KG-RAG: Enhancing GUI Agent Decision-Making via Knowledge Graph-Driven Retrieval-Augmented Generation
di: Guan, Ziyi, et al.
Pubblicazione: (2025)
di: Guan, Ziyi, et al.
Pubblicazione: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
DeepMoLM: Leveraging Visual and Geometric Structural Information for Molecule-Text Modeling
di: Lan, Jing, et al.
Pubblicazione: (2026)
di: Lan, Jing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ALMol: Aligned Language-Molecule Translation LLMs through Offline Preference Contrastive Optimisation
di: Gkoumas, Dimitris
Pubblicazione: (2024) -
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
di: Sun, Tao, et al.
Pubblicazione: (2025) -
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
di: Song, Dingjie, et al.
Pubblicazione: (2024) -
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026) -
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
di: Zhou, Ziyi, et al.
Pubblicazione: (2024)