LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Liya, Cong, Peizhuang, Ding, Jingzhe, Ji, Aowei, Wu, Wenya, Hou, Jiani, Wu, Chunjie, Gao, Xiang, Liu, Jingkai, Huan, Zhou, Sun, Xuelei, Yang, Yang, Jiao, Jianpeng, Hu, Liang, Chen, Xinjie, Liu, Jiashuo, Yang, Tong, Wang, Zaiyuan, Zhang, Ge, Huang, Wenhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
por: Liu, Jiashuo, et al.
Publicado: (2025)
por: Liu, Jiashuo, et al.
Publicado: (2025)
VeRA: Verified Reasoning Data Augmentation at Scale
por: Cheng, Zerui, et al.
Publicado: (2026)
por: Cheng, Zerui, et al.
Publicado: (2026)
Rank Also Matters: Hierarchical Configuration for Mixture of Adapter Experts in LLM Fine-Tuning
por: Cong, Peizhuang, et al.
Publicado: (2025)
por: Cong, Peizhuang, et al.
Publicado: (2025)
BATON: Enhancing Batch-wise Inference Efficiency for Large Language Models via Dynamic Re-batching
por: Cong, Peizhuang, et al.
Publicado: (2024)
por: Cong, Peizhuang, et al.
Publicado: (2024)
INT-FlashAttention: Enabling Flash Attention for INT8 Quantization
por: Chen, Shimao, et al.
Publicado: (2024)
por: Chen, Shimao, et al.
Publicado: (2024)
Anomalous Chern-Simons orbital magnetoelectric coupling of three-dimensional Chern insulators: gauge-discontinuity formalism and adiabatic pumping
por: Xue, Yang, et al.
Publicado: (2025)
por: Xue, Yang, et al.
Publicado: (2025)
Prediction Is All MoE Needs: Expert Load Distribution Goes from Fluctuating to Stabilizing
por: Cong, Peizhuang, et al.
Publicado: (2024)
por: Cong, Peizhuang, et al.
Publicado: (2024)
DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains
por: Zhao, Xiying, et al.
Publicado: (2025)
por: Zhao, Xiying, et al.
Publicado: (2025)
First Record of Fossil Wood Shimakuroxylon from the Jurassic of Qinghai–Xizang (Tibetan) Plateau
por: Mengyu Chen, et al.
Publicado: (2026)
por: Mengyu Chen, et al.
Publicado: (2026)
Clip Body and Tail Separately: High Probability Guarantees for DPSGD with Heavy Tails
por: Sha, Haichao, et al.
Publicado: (2024)
por: Sha, Haichao, et al.
Publicado: (2024)
WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints
por: Wang, Zexuan, et al.
Publicado: (2026)
por: Wang, Zexuan, et al.
Publicado: (2026)
Quality at the Tail of Machine Learning Inference
por: Yang, Zhengxin, et al.
Publicado: (2022)
por: Yang, Zhengxin, et al.
Publicado: (2022)
Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in $\{\pm 1, \pm i\}$
por: Wang, Feiyu, et al.
Publicado: (2025)
por: Wang, Feiyu, et al.
Publicado: (2025)
FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning
por: Hu, Liang, et al.
Publicado: (2025)
por: Hu, Liang, et al.
Publicado: (2025)
Domain Adversarial Active Learning for Domain Generalization Classification
por: Chen, Jianting, et al.
Publicado: (2024)
por: Chen, Jianting, et al.
Publicado: (2024)
MemeBLIP2: A novel lightweight multimodal system to detect harmful memes
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
Geometric Prior Guided Feature Representation Learning for Long-Tailed Classification
por: Ma, Yanbiao, et al.
Publicado: (2024)
por: Ma, Yanbiao, et al.
Publicado: (2024)
FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
por: Zeng, Zhiyuan, et al.
Publicado: (2025)
por: Zeng, Zhiyuan, et al.
Publicado: (2025)
Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?
por: Zhang, Qinyan, et al.
Publicado: (2025)
por: Zhang, Qinyan, et al.
Publicado: (2025)
TaE: Task-aware Expandable Representation for Long Tail Class Incremental Learning
por: Li, Linjie, et al.
Publicado: (2024)
por: Li, Linjie, et al.
Publicado: (2024)
ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
por: Ren, Weiming, et al.
Publicado: (2024)
por: Ren, Weiming, et al.
Publicado: (2024)
TabularMath: Evaluating Computational Extrapolation in Tabular Learning via Program-Verified Synthesis
por: Cheng, Zerui, et al.
Publicado: (2026)
por: Cheng, Zerui, et al.
Publicado: (2026)
RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization
por: Zhiyuan, Zeng, et al.
Publicado: (2025)
por: Zhiyuan, Zeng, et al.
Publicado: (2025)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
por: Yang, Dejie, et al.
Publicado: (2025)
por: Yang, Dejie, et al.
Publicado: (2025)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
por: Wu, Jiayun, et al.
Publicado: (2025)
por: Wu, Jiayun, et al.
Publicado: (2025)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
por: Yang, Chenghao, et al.
Publicado: (2025)
por: Yang, Chenghao, et al.
Publicado: (2025)
Two-dimensional quantum droplets in binary quadrupolar condensates
por: Yang, Aowei, et al.
Publicado: (2024)
por: Yang, Aowei, et al.
Publicado: (2024)
A Sharp Gaussian Tail Bound for Sums of Uniforms
por: He, Xinjie, et al.
Publicado: (2023)
por: He, Xinjie, et al.
Publicado: (2023)
Tensor Polynomial Additive Model
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Enhancing Distributional Stability among Sub-populations
por: Liu, Jiashuo, et al.
Publicado: (2022)
por: Liu, Jiashuo, et al.
Publicado: (2022)
OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice
por: Wang, Rongyang, et al.
Publicado: (2026)
por: Wang, Rongyang, et al.
Publicado: (2026)
Evaluation of the impact of diagnostic blood loss and red blood cell transfusion in very‐low‐birth‐weight anaemic neonates during hospitalization: A multi‐centre retrospective clinical study
por: Ting Ma, et al.
Publicado: (2024)
por: Ting Ma, et al.
Publicado: (2024)
General Many-Body Perturbation Framework for Moiré Systems
por: Lu, Xin, et al.
Publicado: (2025)
por: Lu, Xin, et al.
Publicado: (2025)
Exploring $\ell_0$ Sparsification for Inference-free Sparse Retrievers
por: Shen, Xinjie, et al.
Publicado: (2025)
por: Shen, Xinjie, et al.
Publicado: (2025)
Decoupled Federated Learning on Long-Tailed and Non-IID data with Feature Statistics
por: Chen, Zhuoxin, et al.
Publicado: (2024)
por: Chen, Zhuoxin, et al.
Publicado: (2024)
ATLAS: Autoformalizing Theorems through Lifting, Augmentation, and Synthesis of Data
por: Liu, Xiaoyang, et al.
Publicado: (2025)
por: Liu, Xiaoyang, et al.
Publicado: (2025)
Exploring the Transpositioning‐Translanguaging‐Co‐Learning Approach as a Motivational Driver in Learning Japanese as a Third Language
por: Miaomiao Zuo, et al.
Publicado: (2026)
por: Miaomiao Zuo, et al.
Publicado: (2026)
Approximated Orthogonal Projection Unit: Stabilizing Regression Network Training Using Natural Gradient
por: Wang, Shaoqi, et al.
Publicado: (2024)
por: Wang, Shaoqi, et al.
Publicado: (2024)
Bridging Multicalibration and Out-of-distribution Generalization Beyond Covariate Shift
por: Wu, Jiayun, et al.
Publicado: (2024)
por: Wu, Jiayun, et al.
Publicado: (2024)
Preoperative Professional Tooth Cleaning as a Preventive Measure for Postoperative Pneumonia in OSCC Patients: A Retrospective Study
por: Chuqiao Xiao, et al.
Publicado: (2026)
por: Chuqiao Xiao, et al.
Publicado: (2026)
Ejemplares similares
-
LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics
por: Liu, Jiashuo, et al.
Publicado: (2025) -
VeRA: Verified Reasoning Data Augmentation at Scale
por: Cheng, Zerui, et al.
Publicado: (2026) -
Rank Also Matters: Hierarchical Configuration for Mixture of Adapter Experts in LLM Fine-Tuning
por: Cong, Peizhuang, et al.
Publicado: (2025) -
BATON: Enhancing Batch-wise Inference Efficiency for Large Language Models via Dynamic Re-batching
por: Cong, Peizhuang, et al.
Publicado: (2024) -
INT-FlashAttention: Enabling Flash Attention for INT8 Quantization
por: Chen, Shimao, et al.
Publicado: (2024)