Stress-Testing Model Specs Reveals Character Differences among Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jifan, Sleight, Henry, Peng, Andi, Schulman, John, Durmus, Esin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
por: Guo, Shiyuan, et al.
Publicado: (2025)
por: Guo, Shiyuan, et al.
Publicado: (2025)
Looking Inward: Language Models Can Learn About Themselves by Introspection
por: Binder, Felix J, et al.
Publicado: (2024)
por: Binder, Felix J, et al.
Publicado: (2024)
From Language Models over Tokens to Language Models over Characters
por: Vieira, Tim, et al.
Publicado: (2024)
por: Vieira, Tim, et al.
Publicado: (2024)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025)
por: Li, Guanghao, et al.
Publicado: (2025)
Unsupervised Elicitation of Language Models
por: Wen, Jiaxin, et al.
Publicado: (2025)
por: Wen, Jiaxin, et al.
Publicado: (2025)
SpecFuse: Ensembling Large Language Models via Next-Segment Prediction
por: Lv, Bo, et al.
Publicado: (2024)
por: Lv, Bo, et al.
Publicado: (2024)
Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions
por: Huang, Saffron, et al.
Publicado: (2025)
por: Huang, Saffron, et al.
Publicado: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
por: Zhang, Jinbin, et al.
Publicado: (2025)
por: Zhang, Jinbin, et al.
Publicado: (2025)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
por: Yang, Rubing, et al.
Publicado: (2025)
por: Yang, Rubing, et al.
Publicado: (2025)
Sequence-to-Sequence Language Models for Character and Emotion Detection in Dream Narratives
por: Cortal, Gustave
Publicado: (2024)
por: Cortal, Gustave
Publicado: (2024)
Leveraging Large Language Models for Active Merchant Non-player Characters
por: Kim, Byungjun, et al.
Publicado: (2024)
por: Kim, Byungjun, et al.
Publicado: (2024)
The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling
por: Zhang, Ruochen, et al.
Publicado: (2024)
por: Zhang, Ruochen, et al.
Publicado: (2024)
Building Models of Neurological Language
por: Watkins, Henry
Publicado: (2025)
por: Watkins, Henry
Publicado: (2025)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
por: Zhao, Weilin, et al.
Publicado: (2025)
por: Zhao, Weilin, et al.
Publicado: (2025)
Towards Measuring the Representation of Subjective Global Opinions in Language Models
por: Durmus, Esin, et al.
Publicado: (2023)
por: Durmus, Esin, et al.
Publicado: (2023)
Collective Constitutional AI: Aligning a Language Model with Public Input
por: Huang, Saffron, et al.
Publicado: (2024)
por: Huang, Saffron, et al.
Publicado: (2024)
Persona Vectors: Monitoring and Controlling Character Traits in Language Models
por: Chen, Runjin, et al.
Publicado: (2025)
por: Chen, Runjin, et al.
Publicado: (2025)
Differences in Text Generated by Diffusion and Autoregressive Language Models
por: Zhang, Zeyang, et al.
Publicado: (2026)
por: Zhang, Zeyang, et al.
Publicado: (2026)
Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models
por: Ensign, Danielle, et al.
Publicado: (2025)
por: Ensign, Danielle, et al.
Publicado: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Revisiting Character-level Adversarial Attacks for Language Models
por: Rocamora, Elias Abad, et al.
Publicado: (2024)
por: Rocamora, Elias Abad, et al.
Publicado: (2024)
Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
por: Slocum, Stewart, et al.
Publicado: (2025)
por: Slocum, Stewart, et al.
Publicado: (2025)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
por: Gu, Xiaojie, et al.
Publicado: (2026)
por: Gu, Xiaojie, et al.
Publicado: (2026)
Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
por: Xu, Xiaoyue, et al.
Publicado: (2024)
por: Xu, Xiaoyue, et al.
Publicado: (2024)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
por: Samuel, Vinay, et al.
Publicado: (2024)
por: Samuel, Vinay, et al.
Publicado: (2024)
Revealing the Inherent Instructability of Pre-Trained Language Models
por: An, Seokhyun, et al.
Publicado: (2024)
por: An, Seokhyun, et al.
Publicado: (2024)
InteChar: A Unified Oracle Bone Character List for Ancient Chinese Language Modeling
por: Diao, Xiaolei, et al.
Publicado: (2025)
por: Diao, Xiaolei, et al.
Publicado: (2025)
Training-Free Test-Time Contrastive Learning for Large Language Models
por: Zheng, Kaiwen, et al.
Publicado: (2026)
por: Zheng, Kaiwen, et al.
Publicado: (2026)
Inverse Scaling in Test-Time Compute
por: Gema, Aryo Pradipta, et al.
Publicado: (2025)
por: Gema, Aryo Pradipta, et al.
Publicado: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
por: Wang, Wentian, et al.
Publicado: (2024)
por: Wang, Wentian, et al.
Publicado: (2024)
Language Model Distillation: A Temporal Difference Imitation Learning Perspective
por: Yu, Zishun, et al.
Publicado: (2025)
por: Yu, Zishun, et al.
Publicado: (2025)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
por: Zhang, Andi, et al.
Publicado: (2024)
por: Zhang, Andi, et al.
Publicado: (2024)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
por: Lian, Jiawei, et al.
Publicado: (2025)
por: Lian, Jiawei, et al.
Publicado: (2025)
When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models
por: Wu, Huyu, et al.
Publicado: (2025)
por: Wu, Huyu, et al.
Publicado: (2025)
Component-Level Lesioning of Language Models Reveals Clinically Aligned Aphasia Phenotypes
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts
por: Xie, Jian, et al.
Publicado: (2023)
por: Xie, Jian, et al.
Publicado: (2023)
Ejemplares similares
-
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
por: Guo, Shiyuan, et al.
Publicado: (2025) -
Looking Inward: Language Models Can Learn About Themselves by Introspection
por: Binder, Felix J, et al.
Publicado: (2024) -
From Language Models over Tokens to Language Models over Characters
por: Vieira, Tim, et al.
Publicado: (2024) -
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
por: Li, Guanghao, et al.
Publicado: (2025) -
Unsupervised Elicitation of Language Models
por: Wen, Jiaxin, et al.
Publicado: (2025)