HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Que, Haoran, Duan, Feiyu, He, Liqun, Mou, Yutao, Zhou, Wangchunshu, Liu, Jiaheng, Rong, Wenge, Wang, Zekun Moore, Yang, Jian, Zhang, Ge, Peng, Junran, Zhang, Zhaoxiang, Zhang, Songyang, Chen, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing LLMs via High-Knowledge Data Selection
par: Duan, Feiyu, et autres
Publié: (2025)
par: Duan, Feiyu, et autres
Publié: (2025)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
par: Wang, Zekun Moore, et autres
Publié: (2023)
par: Wang, Zekun Moore, et autres
Publié: (2023)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
MIO: A Foundation Model on Multimodal Tokens
par: Wang, Zekun, et autres
Publié: (2024)
par: Wang, Zekun, et autres
Publié: (2024)
PositionID: LLMs can Control Lengths, Copy and Paste with Explicit Positional Awareness
par: Wang, Zekun, et autres
Publié: (2024)
par: Wang, Zekun, et autres
Publié: (2024)
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types
par: Mou, Yutao, et autres
Publié: (2024)
par: Mou, Yutao, et autres
Publié: (2024)
NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities
par: Li, Mo, et autres
Publié: (2024)
par: Li, Mo, et autres
Publié: (2024)
OOD-HOI: Text-Driven 3D Whole-Body Human-Object Interactions Generation Beyond Training Domains
par: Zhang, Yixuan, et autres
Publié: (2024)
par: Zhang, Yixuan, et autres
Publié: (2024)
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
par: Ge, Qiming, et autres
Publié: (2025)
par: Ge, Qiming, et autres
Publié: (2025)
Seek for Incantations: Towards Accurate Text-to-Image Diffusion Synthesis through Prompt Engineering
par: Yu, Chang, et autres
Publié: (2024)
par: Yu, Chang, et autres
Publié: (2024)
Preference-Aware Memory Update for Long-Term LLM Agents
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
par: Zhang, Alexander, et autres
Publié: (2025)
par: Zhang, Alexander, et autres
Publié: (2025)
Are Your LLMs Capable of Stable Reasoning?
par: Liu, Junnan, et autres
Publié: (2024)
par: Liu, Junnan, et autres
Publié: (2024)
LongIns: A Challenging Long-context Instruction-based Exam for LLMs
par: Gavin, Shawn, et autres
Publié: (2024)
par: Gavin, Shawn, et autres
Publié: (2024)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
par: Zhang, Beichen, et autres
Publié: (2024)
par: Zhang, Beichen, et autres
Publié: (2024)
PopAlign: Diversifying Contrasting Patterns for a More Comprehensive Alignment
par: Wang, Zekun Moore, et autres
Publié: (2024)
par: Wang, Zekun Moore, et autres
Publié: (2024)
Hello Again! LLM-powered Personalized Agent for Long-term Dialogue
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Shared DIFF Transformer
par: Cang, Yueyang, et autres
Publié: (2025)
par: Cang, Yueyang, et autres
Publié: (2025)
CityGaussianV2: Efficient and Geometrically Accurate Reconstruction for Large-Scale Scenes
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
VGGT-X: When VGGT Meets Dense Novel View Synthesis
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis
par: Yang, Chen, et autres
Publié: (2024)
par: Yang, Chen, et autres
Publié: (2024)
EmoDiffusion: Enhancing Emotional 3D Facial Animation with Latent Diffusion Models
par: Zhang, Yixuan, et autres
Publié: (2025)
par: Zhang, Yixuan, et autres
Publié: (2025)
D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models
par: Que, Haoran, et autres
Publié: (2024)
par: Que, Haoran, et autres
Publié: (2024)
FurniScene: A Large-scale 3D Room Dataset with Intricate Furnishing Scenes
par: Zhang, Genghao, et autres
Publié: (2024)
par: Zhang, Genghao, et autres
Publié: (2024)
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
par: Qiao, Yuxuan, et autres
Publié: (2024)
par: Qiao, Yuxuan, et autres
Publié: (2024)
Hello, world!
par: Chiang, Tai-Wei
Publié: (2025)
par: Chiang, Tai-Wei
Publié: (2025)
Hello world
par: Qu, Chenyang
Publié: (2026)
par: Qu, Chenyang
Publié: (2026)
Hello, Dolly
Publié: (1997)
Publié: (1997)
Hello 2
Hello 4
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
A Comprehensive Survey on Long Context Language Modeling
par: Liu, Jiaheng, et autres
Publié: (2025)
par: Liu, Jiaheng, et autres
Publié: (2025)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
par: Liu, Hongwei, et autres
Publié: (2024)
par: Liu, Hongwei, et autres
Publié: (2024)
StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
par: Wang, Sizhe, et autres
Publié: (2026)
par: Wang, Sizhe, et autres
Publié: (2026)
GSPlane: Concise and Accurate Planar Reconstruction via Structured Representation
par: Gan, Ruitong, et autres
Publié: (2025)
par: Gan, Ruitong, et autres
Publié: (2025)
NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos
par: Yang, Yuxue, et autres
Publié: (2026)
par: Yang, Yuxue, et autres
Publié: (2026)
MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets
par: Li, Zeyu, et autres
Publié: (2024)
par: Li, Zeyu, et autres
Publié: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
par: He, Yancheng, et autres
Publié: (2025)
par: He, Yancheng, et autres
Publié: (2025)
Uncovering Capabilities of Model Pruning in Graph Contrastive Learning
par: Wu, Junran, et autres
Publié: (2024)
par: Wu, Junran, et autres
Publié: (2024)
Documents similaires
-
Enhancing LLMs via High-Knowledge Data Selection
par: Duan, Feiyu, et autres
Publié: (2025) -
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
par: Wang, Zekun Moore, et autres
Publié: (2023) -
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
par: Wang, Pei, et autres
Publié: (2024) -
MIO: A Foundation Model on Multimodal Tokens
par: Wang, Zekun, et autres
Publié: (2024) -
PositionID: LLMs can Control Lengths, Copy and Paste with Explicit Positional Awareness
par: Wang, Zekun, et autres
Publié: (2024)