Structural-Entropy-Based Sample Selection for Efficient and Effective Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Tianchi, Zhu, Jiangning, Ma, Guozu, Lin, Minzhi, Chen, Wei, Yang, Weikai, Liu, Shixia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
por: Xie, Tianchi, et al.
Publicado: (2025)
por: Xie, Tianchi, et al.
Publicado: (2025)
InfoDet: A Dataset for Infographic Element Detection
por: Zhu, Jiangning, et al.
Publicado: (2025)
por: Zhu, Jiangning, et al.
Publicado: (2025)
Learning Multi-view Anomaly Detection with Efficient Adaptive Selection
por: He, Haoyang, et al.
Publicado: (2024)
por: He, Haoyang, et al.
Publicado: (2024)
m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
por: Ma, Zixian, et al.
Publicado: (2024)
por: Ma, Zixian, et al.
Publicado: (2024)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
Play to Generalize: Learning to Reason Through Game Play
por: Xie, Yunfei, et al.
Publicado: (2025)
por: Xie, Yunfei, et al.
Publicado: (2025)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
por: Mao, Weian, et al.
Publicado: (2026)
por: Mao, Weian, et al.
Publicado: (2026)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2024)
por: Lin, Junyan, et al.
Publicado: (2024)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
por: Huang, Yixu, et al.
Publicado: (2026)
por: Huang, Yixu, et al.
Publicado: (2026)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
por: Ma, Jian, et al.
Publicado: (2023)
por: Ma, Jian, et al.
Publicado: (2023)
AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning
por: Tang, Yuwei, et al.
Publicado: (2024)
por: Tang, Yuwei, et al.
Publicado: (2024)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
por: Xie, Xudong, et al.
Publicado: (2024)
por: Xie, Xudong, et al.
Publicado: (2024)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
por: Yang, Yiqing, et al.
Publicado: (2025)
por: Yang, Yiqing, et al.
Publicado: (2025)
EfficientIML: Efficient High-Resolution Image Manipulation Localization
por: Li, Jinhan, et al.
Publicado: (2025)
por: Li, Jinhan, et al.
Publicado: (2025)
Energy-Based Constraint Networks: Learning Structural Coherence Across Modalities
por: Shinde, Chirag
Publicado: (2026)
por: Shinde, Chirag
Publicado: (2026)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
por: Zhang, Hongzhi, et al.
Publicado: (2025)
por: Zhang, Hongzhi, et al.
Publicado: (2025)
Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI
por: Vepa, Arvind Murari, et al.
Publicado: (2025)
por: Vepa, Arvind Murari, et al.
Publicado: (2025)
Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection
por: Yang, Ruichao, et al.
Publicado: (2026)
por: Yang, Ruichao, et al.
Publicado: (2026)
ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation
por: Li, Zhen, et al.
Publicado: (2025)
por: Li, Zhen, et al.
Publicado: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
por: Wei, Xinyu, et al.
Publicado: (2025)
por: Wei, Xinyu, et al.
Publicado: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
por: You, Ling, et al.
Publicado: (2025)
por: You, Ling, et al.
Publicado: (2025)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
por: Lim, Gyubeum, et al.
Publicado: (2025)
por: Lim, Gyubeum, et al.
Publicado: (2025)
STEMTOX: From Social Tags to Fine-Grained Toxic Meme Detection via Entropy-Guided Multi-Task Learning
por: Swain, Subhankar, et al.
Publicado: (2025)
por: Swain, Subhankar, et al.
Publicado: (2025)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
por: Zang, Yuhang, et al.
Publicado: (2025)
por: Zang, Yuhang, et al.
Publicado: (2025)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
por: Cao, Qinglong, et al.
Publicado: (2026)
por: Cao, Qinglong, et al.
Publicado: (2026)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
por: Yang, Sihan, et al.
Publicado: (2025)
por: Yang, Sihan, et al.
Publicado: (2025)
Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector
por: Huang, Youcheng, et al.
Publicado: (2024)
por: Huang, Youcheng, et al.
Publicado: (2024)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
Efficient and Effective In-context Demonstration Selection with Coreset
por: Wang, Zihua, et al.
Publicado: (2025)
por: Wang, Zihua, et al.
Publicado: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
Token-Level Entropy Reveals Demographic Disparities in Language Models
por: Lee, Messi H. J.
Publicado: (2025)
por: Lee, Messi H. J.
Publicado: (2025)
Effective Training Data Synthesis for Improving MLLM Chart Understanding
por: Yang, Yuwei, et al.
Publicado: (2025)
por: Yang, Yuwei, et al.
Publicado: (2025)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
por: Peng, Daowan, et al.
Publicado: (2025)
por: Peng, Daowan, et al.
Publicado: (2025)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
OW-CLIP: Data-Efficient Visual Supervision for Open-World Object Detection via Human-AI Collaboration
por: Duan, Junwen, et al.
Publicado: (2025)
por: Duan, Junwen, et al.
Publicado: (2025)
EPEE: Towards Efficient and Effective Foundation Models in Biomedicine
por: Zhan, Zaifu, et al.
Publicado: (2025)
por: Zhan, Zaifu, et al.
Publicado: (2025)
Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
por: Bannur, Shruthi, et al.
Publicado: (2023)
por: Bannur, Shruthi, et al.
Publicado: (2023)
CycleChart: A Unified Consistency-Based Learning Framework for Bidirectional Chart Understanding and Generation
por: Deng, Dazhen, et al.
Publicado: (2025)
por: Deng, Dazhen, et al.
Publicado: (2025)
Ejemplares similares
-
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
por: Xie, Tianchi, et al.
Publicado: (2025) -
InfoDet: A Dataset for Infographic Element Detection
por: Zhu, Jiangning, et al.
Publicado: (2025) -
Learning Multi-view Anomaly Detection with Efficient Adaptive Selection
por: He, Haoyang, et al.
Publicado: (2024) -
m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
por: Ma, Zixian, et al.
Publicado: (2024) -
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
por: Li, Yifan, et al.
Publicado: (2025)