Identifying Multiple Personalities in Large Language Models with External Evaluation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Song, Xiaoyang, Adachi, Yuta, Feng, Jessie, Lin, Mouwei, Yu, Linhao, Li, Frank, Gupta, Akshat, Anumanchipalli, Gopala, Kaur, Simerjot |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Self-Assessment Tests are Unreliable Measures of LLM Personality
von: Gupta, Akshat, et al.
Veröffentlicht: (2023)
von: Gupta, Akshat, et al.
Veröffentlicht: (2023)
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
A Unified Framework for Model Editing
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
von: Yoon, Junsang, et al.
Veröffentlicht: (2024)
von: Yoon, Junsang, et al.
Veröffentlicht: (2024)
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
Model Editing at Scale leads to Gradual and Catastrophic Forgetting
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)
How Do LLMs Use Their Depth?
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
Efficient Knowledge Editing via Minimal Precomputation
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia
von: Chen, Zixun, et al.
Veröffentlicht: (2025)
von: Chen, Zixun, et al.
Veröffentlicht: (2025)
PokerBench: Training Large Language Models to become Professional Poker Players
von: Zhuang, Richard, et al.
Veröffentlicht: (2025)
von: Zhuang, Richard, et al.
Veröffentlicht: (2025)
Towards Hierarchical Spoken Language Dysfluency Modeling
von: Lian, Jiachen, et al.
Veröffentlicht: (2024)
von: Lian, Jiachen, et al.
Veröffentlicht: (2024)
FineZip : Pushing the Limits of Large Language Models for Practical Lossless Text Compression
von: Mittu, Fazal, et al.
Veröffentlicht: (2024)
von: Mittu, Fazal, et al.
Veröffentlicht: (2024)
Evolutionary Strategies lead to Catastrophic Forgetting in LLMs
von: Abdi, Immanuel, et al.
Veröffentlicht: (2026)
von: Abdi, Immanuel, et al.
Veröffentlicht: (2026)
Lifelong Knowledge Editing requires Better Regularization
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
Norm Growth and Stability Challenges in Localized Sequential Knowledge Editing
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
von: Gupta, Akshat, et al.
Veröffentlicht: (2025)
Conservative Bias in Large Language Models: Measuring Relation Predictions
von: Aguda, Toyin, et al.
Veröffentlicht: (2025)
von: Aguda, Toyin, et al.
Veröffentlicht: (2025)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2024)
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2024)
Scaling Spoken Language Models with Syllabic Speech Tokenization
von: Lee, Nicholas, et al.
Veröffentlicht: (2025)
von: Lee, Nicholas, et al.
Veröffentlicht: (2025)
Large Language Models as Financial Data Annotators: A Study on Effectiveness and Efficiency
von: Aguda, Toyin, et al.
Veröffentlicht: (2024)
von: Aguda, Toyin, et al.
Veröffentlicht: (2024)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
von: Lian, Jiachen, et al.
Veröffentlicht: (2022)
von: Lian, Jiachen, et al.
Veröffentlicht: (2022)
Grounding LLM Reasoning with Knowledge Graphs
von: Amayuelas, Alfonso, et al.
Veröffentlicht: (2025)
von: Amayuelas, Alfonso, et al.
Veröffentlicht: (2025)
Multimodal Segmentation for Vocal Tract Modeling
von: Jain, Rishi, et al.
Veröffentlicht: (2024)
von: Jain, Rishi, et al.
Veröffentlicht: (2024)
FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
von: Magomere, Jabez, et al.
Veröffentlicht: (2025)
von: Magomere, Jabez, et al.
Veröffentlicht: (2025)
FinQAPT: Empowering Financial Decisions with End-to-End LLM-driven Question Answering Pipeline
von: Singh, Kuldeep, et al.
Veröffentlicht: (2024)
von: Singh, Kuldeep, et al.
Veröffentlicht: (2024)
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2023)
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2023)
Sylber 2.0: A Universal Syllable Embedding
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2026)
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2026)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
von: Lin, Guan-Ting, et al.
Veröffentlicht: (2025)
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains
von: Khanmohammadi, Reza, et al.
Veröffentlicht: (2026)
von: Khanmohammadi, Reza, et al.
Veröffentlicht: (2026)
Coding Speech through Vocal Tract Kinematics
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2024)
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2024)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2023)
von: Cho, Cheol Jun, et al.
Veröffentlicht: (2023)
DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts
von: Sun, Xiongtao, et al.
Veröffentlicht: (2024)
von: Sun, Xiongtao, et al.
Veröffentlicht: (2024)
A Variational Approach for Mitigating Entity Bias in Relation Extraction
von: Mensah, Samuel, et al.
Veröffentlicht: (2025)
von: Mensah, Samuel, et al.
Veröffentlicht: (2025)
Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks
von: Erdogan, Lutfi Eren, et al.
Veröffentlicht: (2025)
von: Erdogan, Lutfi Eren, et al.
Veröffentlicht: (2025)
Skills-in-Context Prompting: Unlocking Compositionality in Large Language Models
von: Chen, Jiaao, et al.
Veröffentlicht: (2023)
von: Chen, Jiaao, et al.
Veröffentlicht: (2023)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Evaluating the External and Parametric Knowledge Fusion of Large Language Models
von: Zhang, Hao, et al.
Veröffentlicht: (2024)
von: Zhang, Hao, et al.
Veröffentlicht: (2024)
Thrust: Adaptively Propels Large Language Models with External Knowledge
von: Zhao, Xinran, et al.
Veröffentlicht: (2023)
von: Zhao, Xinran, et al.
Veröffentlicht: (2023)
Echoes of Agreement: Argument Driven Opinion Shifts in Large Language Models
von: Kaur, Avneet
Veröffentlicht: (2025)
von: Kaur, Avneet
Veröffentlicht: (2025)
Ähnliche Einträge
-
Self-Assessment Tests are Unreliable Measures of LLM Personality
von: Gupta, Akshat, et al.
Veröffentlicht: (2023) -
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
von: Gupta, Akshat, et al.
Veröffentlicht: (2024) -
A Unified Framework for Model Editing
von: Gupta, Akshat, et al.
Veröffentlicht: (2024) -
Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
von: Yoon, Junsang, et al.
Veröffentlicht: (2024) -
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
von: Gupta, Akshat, et al.
Veröffentlicht: (2024)