Picking the Cream of the Crop: Visual-Centric Data Selection with Collaborative Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Zhenyu, Li, Yunxin, Hu, Baotian, Luo, Wenhan, Wang, Yaowei, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
par: Chen, Xinyu, et autres
Publié: (2025)
par: Chen, Xinyu, et autres
Publié: (2025)
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
par: Li, Jinchao, et autres
Publié: (2026)
par: Li, Jinchao, et autres
Publié: (2026)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
par: Li, Yunxin, et autres
Publié: (2023)
par: Li, Yunxin, et autres
Publié: (2023)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
par: Li, Yunxin, et autres
Publié: (2023)
par: Li, Yunxin, et autres
Publié: (2023)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation
par: Hu, Xinshuo, et autres
Publié: (2023)
par: Hu, Xinshuo, et autres
Publié: (2023)
In-Context Learning State Vector with Inner and Momentum Optimization
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
Take Off the Training Wheels Progressive In-Context Learning for Effective Alignment
par: Liu, Zhenyu, et autres
Publié: (2025)
par: Liu, Zhenyu, et autres
Publié: (2025)
Improving Attributed Text Generation of Large Language Models via Preference Learning
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
A Unified Agentic Framework for Evaluating Conditional Image Generation
par: Wang, Jifang, et autres
Publié: (2025)
par: Wang, Jifang, et autres
Publié: (2025)
SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection
par: Liu, Liangxin, et autres
Publié: (2024)
par: Liu, Liangxin, et autres
Publié: (2024)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
par: Lyu, Mengyao, et autres
Publié: (2025)
par: Lyu, Mengyao, et autres
Publié: (2025)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
An Evaluation-Centric Paradigm for Scientific Visualization Agents
par: Ai, Kuangshi, et autres
Publié: (2025)
par: Ai, Kuangshi, et autres
Publié: (2025)
ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
par: Huang, Shouzheng, et autres
Publié: (2026)
par: Huang, Shouzheng, et autres
Publié: (2026)
FunnelRAG: A Coarse-to-Fine Progressive Retrieval Paradigm for RAG
par: Zhao, Xinping, et autres
Publié: (2024)
par: Zhao, Xinping, et autres
Publié: (2024)
Generative Multimodal Entity Linking
par: Shi, Senbao, et autres
Publié: (2023)
par: Shi, Senbao, et autres
Publié: (2023)
Improving Value-based Process Verifier via Low-Cost Variance Reduction
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
Medico: Towards Hallucination Detection and Correction with Multi-source Evidence Fusion
par: Zhao, Xinping, et autres
Publié: (2024)
par: Zhao, Xinping, et autres
Publié: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model
par: Hu, Xinshuo, et autres
Publié: (2025)
par: Hu, Xinshuo, et autres
Publié: (2025)
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
par: Chen, Zhuoen, et autres
Publié: (2026)
par: Chen, Zhuoen, et autres
Publié: (2026)
DCMM-SQL: Automated Data-Centric Pipeline and Multi-Model Collaboration Training for Text-to-SQL Model
par: Xie, Yuanzhen, et autres
Publié: (2025)
par: Xie, Yuanzhen, et autres
Publié: (2025)
AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation
par: Shi, Haoyuan, et autres
Publié: (2025)
par: Shi, Haoyuan, et autres
Publié: (2025)
LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV Indexing
par: Li, Dongfang, et autres
Publié: (2026)
par: Li, Dongfang, et autres
Publié: (2026)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
par: Liu, Zhenyu, et autres
Publié: (2025)
par: Liu, Zhenyu, et autres
Publié: (2025)
CoRanking: Collaborative Ranking with Small and Large Ranking Agents
par: Liu, Wenhan, et autres
Publié: (2025)
par: Liu, Wenhan, et autres
Publié: (2025)
On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey
par: Zhang, Meishan, et autres
Publié: (2025)
par: Zhang, Meishan, et autres
Publié: (2025)
nvAgent: Automated Data Visualization from Natural Language via Collaborative Agent Workflow
par: Ouyang, Geliang, et autres
Publié: (2025)
par: Ouyang, Geliang, et autres
Publié: (2025)
FilmAgent: A Multi-Agent Framework for End-to-End Film Automation in Virtual 3D Spaces
par: Xu, Zhenran, et autres
Publié: (2025)
par: Xu, Zhenran, et autres
Publié: (2025)
SEER: Self-Aligned Evidence Extraction for Retrieval-Augmented Generation
par: Zhao, Xinping, et autres
Publié: (2024)
par: Zhao, Xinping, et autres
Publié: (2024)
Documents similaires
-
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
par: Chen, Xinyu, et autres
Publié: (2025) -
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
par: Li, Yunxin, et autres
Publié: (2025) -
WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
par: Li, Jinchao, et autres
Publié: (2026) -
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
par: Li, Yunxin, et autres
Publié: (2024) -
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)