PSST: A Benchmark for Evaluation-driven Text Public-Speaking Style Transfer
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Huashan, Wu, Yixiao, Ye, Yuhao, Yang, Yizhe, Li, Yinghao, Li, Jiawei, Gao, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Please Make it Sound like Human: Encoder-Decoder vs. Decoder-Only Transformers for AI-to-Human Text Style Transfer
por: Paneru, Utsav
Publicado: (2026)
por: Paneru, Utsav
Publicado: (2026)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
por: Yu, Jinzheng, et al.
Publicado: (2025)
por: Yu, Jinzheng, et al.
Publicado: (2025)
RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
por: Dugan, Liam, et al.
Publicado: (2024)
por: Dugan, Liam, et al.
Publicado: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
por: Peters, Sydney, et al.
Publicado: (2025)
por: Peters, Sydney, et al.
Publicado: (2025)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
por: Li, Bowen, et al.
Publicado: (2026)
por: Li, Bowen, et al.
Publicado: (2026)
HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns
por: Wang, Xintao, et al.
Publicado: (2026)
por: Wang, Xintao, et al.
Publicado: (2026)
Vocabulary Transfer for Biomedical Texts: Add Tokens if You Can Not Add Data
por: Singh, Priyanka, et al.
Publicado: (2022)
por: Singh, Priyanka, et al.
Publicado: (2022)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
por: Oketunji, Abiodun Finbarrs
Publicado: (2023)
por: Oketunji, Abiodun Finbarrs
Publicado: (2023)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
por: Muller, Sacha, et al.
Publicado: (2024)
por: Muller, Sacha, et al.
Publicado: (2024)
BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation
por: The Omnilingual MT Team, et al.
Publicado: (2025)
por: The Omnilingual MT Team, et al.
Publicado: (2025)
Policy-driven Knowledge Selection and Response Generation for Document-grounded Dialogue
por: Ma, Longxuan, et al.
Publicado: (2024)
por: Ma, Longxuan, et al.
Publicado: (2024)
EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
por: Yang, Pei, et al.
Publicado: (2026)
por: Yang, Pei, et al.
Publicado: (2026)
Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation
por: Dejl, Adam, et al.
Publicado: (2025)
por: Dejl, Adam, et al.
Publicado: (2025)
Unstructured Text Enhanced Open-domain Dialogue System: A Systematic Survey
por: Ma, Longxuan, et al.
Publicado: (2024)
por: Ma, Longxuan, et al.
Publicado: (2024)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
por: Karinshak, Elise, et al.
Publicado: (2024)
por: Karinshak, Elise, et al.
Publicado: (2024)
Personality, Role, and Expressive Style in Large Language Models: An Interactionist Analysis
por: Nagao, Moe, et al.
Publicado: (2026)
por: Nagao, Moe, et al.
Publicado: (2026)
Controllable Text Generation for Large Language Models: A Survey
por: Liang, Xun, et al.
Publicado: (2024)
por: Liang, Xun, et al.
Publicado: (2024)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
por: Tu, Songjun, et al.
Publicado: (2026)
por: Tu, Songjun, et al.
Publicado: (2026)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
por: Ashuach, Tomer, et al.
Publicado: (2025)
por: Ashuach, Tomer, et al.
Publicado: (2025)
Y-NQ: English-Yorùbá Evaluation dataset for Open-Book Reading Comprehension and Text Generation
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs
por: Wang, Yuxia, et al.
Publicado: (2024)
por: Wang, Yuxia, et al.
Publicado: (2024)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
por: Jiang, Yilin, et al.
Publicado: (2025)
por: Jiang, Yilin, et al.
Publicado: (2025)
Lacuna Language Learning: Leveraging RNNs for Ranked Text Completion in Digitized Coptic Manuscripts
por: Levine, Lauren, et al.
Publicado: (2024)
por: Levine, Lauren, et al.
Publicado: (2024)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
por: Dai, Song, et al.
Publicado: (2025)
por: Dai, Song, et al.
Publicado: (2025)
ConPET: Continual Parameter-Efficient Tuning for Large Language Models
por: Song, Chenyang, et al.
Publicado: (2023)
por: Song, Chenyang, et al.
Publicado: (2023)
Low-Resource Court Judgment Summarization for Common Law Systems
por: Liu, Shuaiqi, et al.
Publicado: (2024)
por: Liu, Shuaiqi, et al.
Publicado: (2024)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
por: Dinh, Tu Anh, et al.
Publicado: (2024)
por: Dinh, Tu Anh, et al.
Publicado: (2024)
myNER: Contextualized Burmese Named Entity Recognition with Bidirectional LSTM and fastText Embeddings via Joint Training with POS Tagging
por: Thant, Kaung Lwin, et al.
Publicado: (2025)
por: Thant, Kaung Lwin, et al.
Publicado: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
por: Ovcharov, Volodymyr
Publicado: (2026)
por: Ovcharov, Volodymyr
Publicado: (2026)
MMSciBench: Benchmarking Language Models on Chinese Multimodal Scientific Problems
por: Ye, Xinwu, et al.
Publicado: (2025)
por: Ye, Xinwu, et al.
Publicado: (2025)
Enhancing Emotion Prediction in News Headlines: Insights from ChatGPT and Seq2Seq Models for Free-Text Generation
por: Gao, Ge, et al.
Publicado: (2024)
por: Gao, Ge, et al.
Publicado: (2024)
Text Summarization With Graph Attention Networks
por: Ardestani, Mohammadreza, et al.
Publicado: (2026)
por: Ardestani, Mohammadreza, et al.
Publicado: (2026)
Fast Quiet-STaR: Thinking Without Thought Tokens
por: Huang, Wei, et al.
Publicado: (2025)
por: Huang, Wei, et al.
Publicado: (2025)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
por: Le, Van-Truong
Publicado: (2026)
por: Le, Van-Truong
Publicado: (2026)
Investigating the Impact of Text Summarization on Topic Modeling
por: Khandelwal, Trishia
Publicado: (2024)
por: Khandelwal, Trishia
Publicado: (2024)
Active Few-Shot Learning for Text Classification
por: Ahmadnia, Saeed, et al.
Publicado: (2025)
por: Ahmadnia, Saeed, et al.
Publicado: (2025)
Normalization of Lithuanian Text Using Regular Expressions
por: Kasparaitis, Pijus
Publicado: (2023)
por: Kasparaitis, Pijus
Publicado: (2023)
Evaluating GenAI for Simplifying Texts for Education: Improving Accuracy and Consistency for Enhanced Readability
por: Day, Stephanie L., et al.
Publicado: (2025)
por: Day, Stephanie L., et al.
Publicado: (2025)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
por: Simhi, Adi, et al.
Publicado: (2024)
por: Simhi, Adi, et al.
Publicado: (2024)
How Do Large Language Models Acquire Factual Knowledge During Pretraining?
por: Chang, Hoyeon, et al.
Publicado: (2024)
por: Chang, Hoyeon, et al.
Publicado: (2024)
Ejemplares similares
-
Please Make it Sound like Human: Encoder-Decoder vs. Decoder-Only Transformers for AI-to-Human Text Style Transfer
por: Paneru, Utsav
Publicado: (2026) -
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
por: Yu, Jinzheng, et al.
Publicado: (2025) -
RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors
por: Dugan, Liam, et al.
Publicado: (2024) -
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
por: Peters, Sydney, et al.
Publicado: (2025) -
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
por: Li, Bowen, et al.
Publicado: (2026)