Stress-Testing Model Specs Reveals Character Differences among Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jifan, Sleight, Henry, Peng, Andi, Schulman, John, Durmus, Esin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
Looking Inward: Language Models Can Learn About Themselves by Introspection
di: Binder, Felix J, et al.
Pubblicazione: (2024)
di: Binder, Felix J, et al.
Pubblicazione: (2024)
From Language Models over Tokens to Language Models over Characters
di: Vieira, Tim, et al.
Pubblicazione: (2024)
di: Vieira, Tim, et al.
Pubblicazione: (2024)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
di: Li, Guanghao, et al.
Pubblicazione: (2025)
di: Li, Guanghao, et al.
Pubblicazione: (2025)
Unsupervised Elicitation of Language Models
di: Wen, Jiaxin, et al.
Pubblicazione: (2025)
di: Wen, Jiaxin, et al.
Pubblicazione: (2025)
SpecFuse: Ensembling Large Language Models via Next-Segment Prediction
di: Lv, Bo, et al.
Pubblicazione: (2024)
di: Lv, Bo, et al.
Pubblicazione: (2024)
Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions
di: Huang, Saffron, et al.
Pubblicazione: (2025)
di: Huang, Saffron, et al.
Pubblicazione: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
di: Zhang, Jinbin, et al.
Pubblicazione: (2025)
di: Zhang, Jinbin, et al.
Pubblicazione: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
di: Yang, Rubing, et al.
Pubblicazione: (2025)
di: Yang, Rubing, et al.
Pubblicazione: (2025)
Sequence-to-Sequence Language Models for Character and Emotion Detection in Dream Narratives
di: Cortal, Gustave
Pubblicazione: (2024)
di: Cortal, Gustave
Pubblicazione: (2024)
Leveraging Large Language Models for Active Merchant Non-player Characters
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling
di: Zhang, Ruochen, et al.
Pubblicazione: (2024)
di: Zhang, Ruochen, et al.
Pubblicazione: (2024)
Building Models of Neurological Language
di: Watkins, Henry
Pubblicazione: (2025)
di: Watkins, Henry
Pubblicazione: (2025)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
di: Zhao, Weilin, et al.
Pubblicazione: (2025)
Towards Measuring the Representation of Subjective Global Opinions in Language Models
di: Durmus, Esin, et al.
Pubblicazione: (2023)
di: Durmus, Esin, et al.
Pubblicazione: (2023)
Collective Constitutional AI: Aligning a Language Model with Public Input
di: Huang, Saffron, et al.
Pubblicazione: (2024)
di: Huang, Saffron, et al.
Pubblicazione: (2024)
Persona Vectors: Monitoring and Controlling Character Traits in Language Models
di: Chen, Runjin, et al.
Pubblicazione: (2025)
di: Chen, Runjin, et al.
Pubblicazione: (2025)
Differences in Text Generated by Diffusion and Autoregressive Language Models
di: Zhang, Zeyang, et al.
Pubblicazione: (2026)
di: Zhang, Zeyang, et al.
Pubblicazione: (2026)
Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2025)
di: Liu, Xin, et al.
Pubblicazione: (2025)
The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models
di: Ensign, Danielle, et al.
Pubblicazione: (2025)
di: Ensign, Danielle, et al.
Pubblicazione: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Revisiting Character-level Adversarial Attacks for Language Models
di: Rocamora, Elias Abad, et al.
Pubblicazione: (2024)
di: Rocamora, Elias Abad, et al.
Pubblicazione: (2024)
Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
di: Gu, Xiaojie, et al.
Pubblicazione: (2026)
di: Gu, Xiaojie, et al.
Pubblicazione: (2026)
Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
di: Xu, Xiaoyue, et al.
Pubblicazione: (2024)
di: Xu, Xiaoyue, et al.
Pubblicazione: (2024)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
Revealing the Inherent Instructability of Pre-Trained Language Models
di: An, Seokhyun, et al.
Pubblicazione: (2024)
di: An, Seokhyun, et al.
Pubblicazione: (2024)
InteChar: A Unified Oracle Bone Character List for Ancient Chinese Language Modeling
di: Diao, Xiaolei, et al.
Pubblicazione: (2025)
di: Diao, Xiaolei, et al.
Pubblicazione: (2025)
Training-Free Test-Time Contrastive Learning for Large Language Models
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
Inverse Scaling in Test-Time Compute
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2025)
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
di: Wang, Wentian, et al.
Pubblicazione: (2024)
di: Wang, Wentian, et al.
Pubblicazione: (2024)
Language Model Distillation: A Temporal Difference Imitation Learning Perspective
di: Yu, Zishun, et al.
Pubblicazione: (2025)
di: Yu, Zishun, et al.
Pubblicazione: (2025)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
di: Zhang, Andi, et al.
Pubblicazione: (2024)
di: Zhang, Andi, et al.
Pubblicazione: (2024)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
di: Lian, Jiawei, et al.
Pubblicazione: (2025)
di: Lian, Jiawei, et al.
Pubblicazione: (2025)
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
di: Wu, Huyu, et al.
Pubblicazione: (2025)
di: Wu, Huyu, et al.
Pubblicazione: (2025)
Component-Level Lesioning of Language Models Reveals Clinically Aligned Aphasia Phenotypes
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models
di: Wang, Cheng, et al.
Pubblicazione: (2025)
di: Wang, Cheng, et al.
Pubblicazione: (2025)
Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts
di: Xie, Jian, et al.
Pubblicazione: (2023)
di: Xie, Jian, et al.
Pubblicazione: (2023)
Documenti analoghi
-
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025) -
Looking Inward: Language Models Can Learn About Themselves by Introspection
di: Binder, Felix J, et al.
Pubblicazione: (2024) -
From Language Models over Tokens to Language Models over Characters
di: Vieira, Tim, et al.
Pubblicazione: (2024) -
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
di: Li, Guanghao, et al.
Pubblicazione: (2025) -
Unsupervised Elicitation of Language Models
di: Wen, Jiaxin, et al.
Pubblicazione: (2025)