The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Minghao, Wang, Weixuan, Liu, Sinuo, Yin, Huifeng, Wang, Xintong, Zhao, Yu, Lyu, Chenyang, Wang, Longyue, Luo, Weihua, Zhang, Kaifu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
New Trends for Modern Machine Translation with Large Reasoning Models
von: Liu, Sinuo, et al.
Veröffentlicht: (2025)
von: Liu, Sinuo, et al.
Veröffentlicht: (2025)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
von: Wang, Xintong, et al.
Veröffentlicht: (2025)
von: Wang, Xintong, et al.
Veröffentlicht: (2025)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
von: Zhao, Yu, et al.
Veröffentlicht: (2024)
von: Zhao, Yu, et al.
Veröffentlicht: (2024)
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
von: Wu, Xinwei, et al.
Veröffentlicht: (2025)
von: Wu, Xinwei, et al.
Veröffentlicht: (2025)
Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning Models
von: Yin, Huifeng, et al.
Veröffentlicht: (2025)
von: Yin, Huifeng, et al.
Veröffentlicht: (2025)
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
von: Zeng, Bo, et al.
Veröffentlicht: (2025)
von: Zeng, Bo, et al.
Veröffentlicht: (2025)
Towards Lightweight, Adaptive and Attribute-Aware Multi-Aspect Controllable Text Generation with Large Language Models
von: Zhu, Chenyu, et al.
Veröffentlicht: (2025)
von: Zhu, Chenyu, et al.
Veröffentlicht: (2025)
(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts
von: Wu, Minghao, et al.
Veröffentlicht: (2024)
von: Wu, Minghao, et al.
Veröffentlicht: (2024)
Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling
von: Jiang, Fan, et al.
Veröffentlicht: (2026)
von: Jiang, Fan, et al.
Veröffentlicht: (2026)
Marco-LLM: Bridging Languages via Massive Multilingual Training for Cross-Lingual Enhancement
von: Ming, Lingfeng, et al.
Veröffentlicht: (2024)
von: Ming, Lingfeng, et al.
Veröffentlicht: (2024)
TransBench: Benchmarking Machine Translation for Industrial-Scale Applications
von: Li, Haijun, et al.
Veröffentlicht: (2025)
von: Li, Haijun, et al.
Veröffentlicht: (2025)
LayAlign: Enhancing Multilingual Reasoning in Large Language Models via Layer-Wise Adaptive Fusion and Alignment Strategy
von: Ruan, Zhiwen, et al.
Veröffentlicht: (2025)
von: Ruan, Zhiwen, et al.
Veröffentlicht: (2025)
Demystifying Multilingual Chain-of-Thought in Process Reward Modeling
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
DeepWideSearch: Benchmarking Depth and Width in Agentic Information Seeking
von: Lan, Tian, et al.
Veröffentlicht: (2025)
von: Lan, Tian, et al.
Veröffentlicht: (2025)
VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation
von: Pan, Jingheng, et al.
Veröffentlicht: (2026)
von: Pan, Jingheng, et al.
Veröffentlicht: (2026)
Marco-Voice Technical Report
von: Tian, Fengping, et al.
Veröffentlicht: (2025)
von: Tian, Fengping, et al.
Veröffentlicht: (2025)
Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs
von: Wu, Xinwei, et al.
Veröffentlicht: (2026)
von: Wu, Xinwei, et al.
Veröffentlicht: (2026)
The Affective Bridge: Preserving Speech Representations while Enhancing Deepfake Detection vian emotional Constraints
von: Li, Yupei, et al.
Veröffentlicht: (2025)
von: Li, Yupei, et al.
Veröffentlicht: (2025)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
von: Wang, Hao, et al.
Veröffentlicht: (2025)
von: Wang, Hao, et al.
Veröffentlicht: (2025)
HSCodeComp: A Realistic and Expert-level Benchmark for Deep Search Agents in Hierarchical Rule Application
von: Yang, Yiqian, et al.
Veröffentlicht: (2025)
von: Yang, Yiqian, et al.
Veröffentlicht: (2025)
Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
ComfyUI-R1: Exploring Reasoning Models for Workflow Generation
von: Xu, Zhenran, et al.
Veröffentlicht: (2025)
von: Xu, Zhenran, et al.
Veröffentlicht: (2025)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
von: Liu, Bingshuai, et al.
Veröffentlicht: (2023)
von: Liu, Bingshuai, et al.
Veröffentlicht: (2023)
A Unified Agentic Framework for Evaluating Conditional Image Generation
von: Wang, Jifang, et al.
Veröffentlicht: (2025)
von: Wang, Jifang, et al.
Veröffentlicht: (2025)
ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
von: Xu, Zhenran, et al.
Veröffentlicht: (2025)
von: Xu, Zhenran, et al.
Veröffentlicht: (2025)
HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
ExpertSteer: Intervening in LLMs through Expert Knowledge
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual Intervention
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
von: Wu, Junchao, et al.
Veröffentlicht: (2026)
von: Wu, Junchao, et al.
Veröffentlicht: (2026)
LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech
von: Yang, Fei, et al.
Veröffentlicht: (2026)
von: Yang, Fei, et al.
Veröffentlicht: (2026)
Chinese Toxic Language Mitigation via Sentiment Polarity Consistent Rewrites
von: Wang, Xintong, et al.
Veröffentlicht: (2025)
von: Wang, Xintong, et al.
Veröffentlicht: (2025)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
von: Lyu, Chenyang, et al.
Veröffentlicht: (2024)
von: Lyu, Chenyang, et al.
Veröffentlicht: (2024)
Building Decision Making Models Through Language Model Regime
von: Zhang, Yu, et al.
Veröffentlicht: (2024)
von: Zhang, Yu, et al.
Veröffentlicht: (2024)
A Paradigm Shift: The Future of Machine Translation Lies with Large Language Models
von: Lyu, Chenyang, et al.
Veröffentlicht: (2023)
von: Lyu, Chenyang, et al.
Veröffentlicht: (2023)
CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
von: Lin, Peiqin, et al.
Veröffentlicht: (2026)
von: Lin, Peiqin, et al.
Veröffentlicht: (2026)
Sharing Matters: Analysing Neurons Across Languages and Tasks in LLMs
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
von: Wang, Weixuan, et al.
Veröffentlicht: (2024)
Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
von: Zhou, Jiang, et al.
Veröffentlicht: (2026)
von: Zhou, Jiang, et al.
Veröffentlicht: (2026)
Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation
von: Ni, Xuanfan, et al.
Veröffentlicht: (2025)
von: Ni, Xuanfan, et al.
Veröffentlicht: (2025)
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
Learning the Bitter Lesson: Empirical Evidence from 20 Years of CVPR Proceedings
von: Yousefi, Mojtaba, et al.
Veröffentlicht: (2024)
von: Yousefi, Mojtaba, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
New Trends for Modern Machine Translation with Large Reasoning Models
von: Liu, Sinuo, et al.
Veröffentlicht: (2025) -
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
von: Wang, Xintong, et al.
Veröffentlicht: (2025) -
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
von: Zhao, Yu, et al.
Veröffentlicht: (2024) -
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
von: Wu, Xinwei, et al.
Veröffentlicht: (2025) -
Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning Models
von: Yin, Huifeng, et al.
Veröffentlicht: (2025)