PARROT: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Çelebi, Yusuf, Ezerceli, Özay, Hussieni, Mahmoud El |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Doppler-Enhanced Deep Learning: Improving Thyroid Nodule Segmentation with YOLOv5 Instance Segmentation
by: Hussieni, Mahmoud El
Published: (2025)
by: Hussieni, Mahmoud El
Published: (2025)
RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models
by: Çelebi, Yusuf, et al.
Published: (2026)
by: Çelebi, Yusuf, et al.
Published: (2026)
TurkColBERT: A Benchmark of Dense and Late-Interaction Models for Turkish Information Retrieval
by: Ezerceli, Özay, et al.
Published: (2025)
by: Ezerceli, Özay, et al.
Published: (2025)
When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs
by: Zagribelnyy, Bogdan, et al.
Published: (2026)
by: Zagribelnyy, Bogdan, et al.
Published: (2026)
Assessing Consistency and Reproducibility in the Outputs of Large Language Models: Evidence Across Diverse Finance and Accounting Tasks
by: Wang, Julian Junyan, et al.
Published: (2025)
by: Wang, Julian Junyan, et al.
Published: (2025)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
by: Lu, Yuxing, et al.
Published: (2025)
by: Lu, Yuxing, et al.
Published: (2025)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
by: Liu, Yujie, et al.
Published: (2025)
by: Liu, Yujie, et al.
Published: (2025)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025)
by: Lu, Guilong, et al.
Published: (2025)
Demystifying Domain-adaptive Post-training for Financial LLMs
by: Ke, Zixuan, et al.
Published: (2025)
by: Ke, Zixuan, et al.
Published: (2025)
EUR-USD Exchange Rate Forecasting Based on Information Fusion with Large Language Models and Deep Learning Methods
by: Ding, Hongcheng, et al.
Published: (2024)
by: Ding, Hongcheng, et al.
Published: (2024)
CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
Beyond Cosine Similarity: Taming Semantic Drift and Antonym Intrusion in a 15-Million Node Turkish Synonym Graph
by: Tosun, Ebubekir, et al.
Published: (2026)
by: Tosun, Ebubekir, et al.
Published: (2026)
A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus
by: Tosun, Ebubekir, et al.
Published: (2026)
by: Tosun, Ebubekir, et al.
Published: (2026)
Enterprise Benchmarks for Large Language Model Evaluation
by: Zhang, Bing, et al.
Published: (2024)
by: Zhang, Bing, et al.
Published: (2024)
Affective-ROPTester: Capability and Bias Analysis of LLMs in Predicting Retinopathy of Prematurity
by: Zhao, Shuai, et al.
Published: (2025)
by: Zhao, Shuai, et al.
Published: (2025)
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
SECQUE: A Benchmark for Evaluating Real-World Financial Analysis Capabilities
by: Yoash, Noga Ben, et al.
Published: (2025)
by: Yoash, Noga Ben, et al.
Published: (2025)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
by: Guo, Sikun, et al.
Published: (2024)
by: Guo, Sikun, et al.
Published: (2024)
FiSTECH: Financial Style Transfer to Enhance Creativity without Hallucinations in LLMs
by: Roychowdhury, Sohini, et al.
Published: (2024)
by: Roychowdhury, Sohini, et al.
Published: (2024)
AdaRec: Adaptive Recommendation with LLMs via Narrative Profiling and Dual-Channel Reasoning
by: Wang, Meiyun, et al.
Published: (2025)
by: Wang, Meiyun, et al.
Published: (2025)
Instructor-inspired Machine Learning for Robust Molecular Property Prediction
by: Wu, Fang, et al.
Published: (2023)
by: Wu, Fang, et al.
Published: (2023)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
by: Asif, Sadia, et al.
Published: (2026)
by: Asif, Sadia, et al.
Published: (2026)
Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning
by: Wu, Xinyi, et al.
Published: (2025)
by: Wu, Xinyi, et al.
Published: (2025)
PEAR: A Robust and Flexible Automation Framework for Ptychography Enabled by Multiple Large Language Model Agents
by: Yin, Xiangyu, et al.
Published: (2024)
by: Yin, Xiangyu, et al.
Published: (2024)
Explainable automatic industrial carbon footprint estimation from bank transaction classification using natural language processing
by: González-González, Jaime, et al.
Published: (2024)
by: González-González, Jaime, et al.
Published: (2024)
Tx-LLM: A Large Language Model for Therapeutics
by: Chaves, Juan Manuel Zambrano, et al.
Published: (2024)
by: Chaves, Juan Manuel Zambrano, et al.
Published: (2024)
MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search
by: Yang, Zonglin, et al.
Published: (2025)
by: Yang, Zonglin, et al.
Published: (2025)
CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling
by: Tang, Zhengyang, et al.
Published: (2025)
by: Tang, Zhengyang, et al.
Published: (2025)
PLLaMa: An Open-source Large Language Model for Plant Science
by: Yang, Xianjun, et al.
Published: (2024)
by: Yang, Xianjun, et al.
Published: (2024)
SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing
by: Zhang, Mingxu, et al.
Published: (2026)
by: Zhang, Mingxu, et al.
Published: (2026)
ORLM: A Customizable Framework in Training Large Models for Automated Optimization Modeling
by: Huang, Chenyu, et al.
Published: (2024)
by: Huang, Chenyu, et al.
Published: (2024)
CausalStock: Deep End-to-end Causal Discovery for News-driven Stock Movement Prediction
by: Li, Shuqi, et al.
Published: (2024)
by: Li, Shuqi, et al.
Published: (2024)
Modeling and Detecting Company Risks from News: A Case Study in Bloomberg News
by: Pei, Jiaxin, et al.
Published: (2025)
by: Pei, Jiaxin, et al.
Published: (2025)
FiMI: A Domain-Specific Language Model for Indian Finance Ecosystem
by: Kathar, Aboli, et al.
Published: (2026)
by: Kathar, Aboli, et al.
Published: (2026)
Exploring Sentiment Dynamics and Predictive Behaviors in Cryptocurrency Discussions by Few-Shot Learning with Large Language Models
by: Tash, Moein Shahiki, et al.
Published: (2024)
by: Tash, Moein Shahiki, et al.
Published: (2024)
Diabetica: Adapting Large Language Model to Enhance Multiple Medical Tasks in Diabetes Care and Management
by: Wei, Lai, et al.
Published: (2024)
by: Wei, Lai, et al.
Published: (2024)
OneComp: One-Line Revolution for Generative AI Model Compression
by: Ichikawa, Yuma, et al.
Published: (2026)
by: Ichikawa, Yuma, et al.
Published: (2026)
FLAG: Financial Long Document Classification via AMR-based GNN
by: Xia, Bolun "Namir", et al.
Published: (2024)
by: Xia, Bolun "Namir", et al.
Published: (2024)
Regress, Don't Guess -- A Regression-like Loss on Number Tokens for Language Models
by: Zausinger, Jonas, et al.
Published: (2024)
by: Zausinger, Jonas, et al.
Published: (2024)
Similar Items
-
Doppler-Enhanced Deep Learning: Improving Thyroid Nodule Segmentation with YOLOv5 Instance Segmentation
by: Hussieni, Mahmoud El
Published: (2025) -
RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models
by: Çelebi, Yusuf, et al.
Published: (2026) -
TurkColBERT: A Benchmark of Dense and Late-Interaction Models for Turkish Information Retrieval
by: Ezerceli, Özay, et al.
Published: (2025) -
When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs
by: Zagribelnyy, Bogdan, et al.
Published: (2026) -
Assessing Consistency and Reproducibility in the Outputs of Large Language Models: Evidence Across Diverse Finance and Accounting Tasks
by: Wang, Julian Junyan, et al.
Published: (2025)