Guardado en:
| Autores principales: | Jin, Yongkang, Luo, Jianwen, Wang, Jingjing, Yao, Jianmin, Hong, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.13748 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-task Prompt Words Learning for Social Media Content Generation
por: Xue, Haochen, et al.
Publicado: (2024)
por: Xue, Haochen, et al.
Publicado: (2024)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
por: Zhou, Gengze, et al.
Publicado: (2025)
por: Zhou, Gengze, et al.
Publicado: (2025)
Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents
por: Xing, Fuyu, et al.
Publicado: (2025)
por: Xing, Fuyu, et al.
Publicado: (2025)
Multimedia Generative Script Learning for Task Planning
por: Wang, Qingyun, et al.
Publicado: (2022)
por: Wang, Qingyun, et al.
Publicado: (2022)
ECHO: Event-Centric Hypergraph Operations via Multi-Agent Collaboration for Multimedia Event Extraction
por: Chu, Hailong, et al.
Publicado: (2026)
por: Chu, Hailong, et al.
Publicado: (2026)
TacoERE: Cluster-aware Compression for Event Relation Extraction
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
por: Zhang, Zhaoyang, et al.
Publicado: (2023)
por: Zhang, Zhaoyang, et al.
Publicado: (2023)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
MMUTF: Multimodal Multimedia Event Argument Extraction with Unified Template Filling
por: Seeberger, Philipp, et al.
Publicado: (2024)
por: Seeberger, Philipp, et al.
Publicado: (2024)
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
por: Lu, Quanfeng, et al.
Publicado: (2025)
por: Lu, Quanfeng, et al.
Publicado: (2025)
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
por: Hu, Yizhi, et al.
Publicado: (2025)
por: Hu, Yizhi, et al.
Publicado: (2025)
EComStage: Stage-wise and Orientation-specific Benchmarking for Large Language Models in E-commerce
por: Zhao, Kaiyan, et al.
Publicado: (2026)
por: Zhao, Kaiyan, et al.
Publicado: (2026)
Few-Shot Relation Extraction with Hybrid Visual Evidence
por: Gong, Jiaying, et al.
Publicado: (2024)
por: Gong, Jiaying, et al.
Publicado: (2024)
CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation
por: Messina, Pablo, et al.
Publicado: (2026)
por: Messina, Pablo, et al.
Publicado: (2026)
Mitigating Multimodal Hallucination via Phase-wise Self-reward
por: Zhang, Yu, et al.
Publicado: (2026)
por: Zhang, Yu, et al.
Publicado: (2026)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
por: Yao, Zonghai, et al.
Publicado: (2026)
por: Yao, Zonghai, et al.
Publicado: (2026)
LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning
por: Kowsher, Md, et al.
Publicado: (2026)
por: Kowsher, Md, et al.
Publicado: (2026)
Distilling Multi-Scale Knowledge for Event Temporal Relation Extraction
por: Yao, Hao-Ren, et al.
Publicado: (2022)
por: Yao, Hao-Ren, et al.
Publicado: (2022)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
por: Cai, Dexian, et al.
Publicado: (2025)
por: Cai, Dexian, et al.
Publicado: (2025)
MLVU: Benchmarking Multi-task Long Video Understanding
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
por: Ohi, Masanari, et al.
Publicado: (2024)
por: Ohi, Masanari, et al.
Publicado: (2024)
Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction
por: Loem, Mengsay, et al.
Publicado: (2025)
por: Loem, Mengsay, et al.
Publicado: (2025)
Towards Better Multi-head Attention via Channel-wise Sample Permutation
por: Yuan, Shen, et al.
Publicado: (2024)
por: Yuan, Shen, et al.
Publicado: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
por: Gao, Junyuan, et al.
Publicado: (2025)
por: Gao, Junyuan, et al.
Publicado: (2025)
FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models
por: Song, Mingyang, et al.
Publicado: (2025)
por: Song, Mingyang, et al.
Publicado: (2025)
Reducing Hallucination in Vision-Language Models via Stage-wise Preference Optimization under Distribution Shift
por: Xu, Qinwu
Publicado: (2026)
por: Xu, Qinwu
Publicado: (2026)
Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
A Structure-aware Generative Model for Biomedical Event Extraction
por: Yuan, Haohan, et al.
Publicado: (2024)
por: Yuan, Haohan, et al.
Publicado: (2024)
GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training
por: Bai, Yuyang, et al.
Publicado: (2026)
por: Bai, Yuyang, et al.
Publicado: (2026)
MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
por: Chen, Haonan, et al.
Publicado: (2025)
por: Chen, Haonan, et al.
Publicado: (2025)
Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
por: Ma, Junxiao, et al.
Publicado: (2025)
por: Ma, Junxiao, et al.
Publicado: (2025)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
por: Thomas, Marshall, et al.
Publicado: (2025)
por: Thomas, Marshall, et al.
Publicado: (2025)
EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
por: Ma, Mingjie, et al.
Publicado: (2024)
por: Ma, Mingjie, et al.
Publicado: (2024)
3M: Multi-modal Multi-task Multi-teacher Learning for Game Event Detection
por: Ng, Thye Shan, et al.
Publicado: (2024)
por: Ng, Thye Shan, et al.
Publicado: (2024)
GETReason: Enhancing Image Context Extraction through Hierarchical Multi-Agent Reasoning
por: Siingh, Shikhhar, et al.
Publicado: (2025)
por: Siingh, Shikhhar, et al.
Publicado: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
por: Kim, Jongha, et al.
Publicado: (2026)
por: Kim, Jongha, et al.
Publicado: (2026)
Ejemplares similares
-
Multi-task Prompt Words Learning for Social Media Content Generation
por: Xue, Haochen, et al.
Publicado: (2024) -
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
por: Zhou, Gengze, et al.
Publicado: (2025) -
Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents
por: Xing, Fuyu, et al.
Publicado: (2025) -
Multimedia Generative Script Learning for Task Planning
por: Wang, Qingyun, et al.
Publicado: (2022) -
ECHO: Event-Centric Hypergraph Operations via Multi-Agent Collaboration for Multimedia Event Extraction
por: Chu, Hailong, et al.
Publicado: (2026)