Disjoint Processing Mechanisms of Hierarchical and Linear Grammars in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sankaranarayanan, Aruna, Hadfield-Menell, Dylan, Mueller, Aaron |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026)
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026)
Prompt Injection as Role Confusion
di: Ye, Charles, et al.
Pubblicazione: (2026)
di: Ye, Charles, et al.
Pubblicazione: (2026)
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2025)
di: Ma, Rachel, et al.
Pubblicazione: (2025)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
di: Ma, Rachel, et al.
Pubblicazione: (2026)
di: Ma, Rachel, et al.
Pubblicazione: (2026)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
Where does In-context Translation Happen in Large Language Models
di: Sia, Suzanna, et al.
Pubblicazione: (2024)
di: Sia, Suzanna, et al.
Pubblicazione: (2024)
A Novel Approach to Eliminating Hallucinations in Large Language Model-Assisted Causal Discovery
di: Sng, Grace, et al.
Pubblicazione: (2024)
di: Sng, Grace, et al.
Pubblicazione: (2024)
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)
Dependency Transformer Grammars: Integrating Dependency Structures into Transformer Language Models
di: Zhao, Yida, et al.
Pubblicazione: (2024)
di: Zhao, Yida, et al.
Pubblicazione: (2024)
Leveraging Grammar Induction for Language Understanding and Generation
di: Kai, Jushi, et al.
Pubblicazione: (2024)
di: Kai, Jushi, et al.
Pubblicazione: (2024)
Cooperative Inverse Reinforcement Learning
di: Hadfield-Menell, Dylan, et al.
Pubblicazione: (2016)
di: Hadfield-Menell, Dylan, et al.
Pubblicazione: (2016)
Explain-then-Process: Using Grammar Prompting to Enhance Grammatical Acceptability Judgments
di: Scheinberg, Russell, et al.
Pubblicazione: (2025)
di: Scheinberg, Russell, et al.
Pubblicazione: (2025)
Diverse Preference Learning for Capabilities and Alignment
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
Identifying Linear Relational Concepts in Large Language Models
di: Chanin, David, et al.
Pubblicazione: (2023)
di: Chanin, David, et al.
Pubblicazione: (2023)
Multi-objective Large Language Model Alignment with Hierarchical Experts
di: Li, Zhuo, et al.
Pubblicazione: (2025)
di: Li, Zhuo, et al.
Pubblicazione: (2025)
CALMA: A Process for Deriving Context-aligned Axes for Language Model Alignment
di: Soni, Prajna, et al.
Pubblicazione: (2025)
di: Soni, Prajna, et al.
Pubblicazione: (2025)
The Grammar of Transformers: A Systematic Review of Interpretability Research on Syntactic Knowledge in Language Models
di: Graichen, Nora, et al.
Pubblicazione: (2026)
di: Graichen, Nora, et al.
Pubblicazione: (2026)
Do Language Models Track Entities Across State Changes?
di: Tang, Zilu, et al.
Pubblicazione: (2026)
di: Tang, Zilu, et al.
Pubblicazione: (2026)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
di: Ma, Qianli, et al.
Pubblicazione: (2025)
di: Ma, Qianli, et al.
Pubblicazione: (2025)
Large Language Models for Extrapolative Modeling of Manufacturing Processes
di: Khanghah, Kiarash Naghavi, et al.
Pubblicazione: (2025)
di: Khanghah, Kiarash Naghavi, et al.
Pubblicazione: (2025)
Sign of the Times: Evaluating the use of Large Language Models for Idiomaticity Detection
di: Phelps, Dylan, et al.
Pubblicazione: (2024)
di: Phelps, Dylan, et al.
Pubblicazione: (2024)
Linear Representations of Political Perspective Emerge in Large Language Models
di: Kim, Junsol, et al.
Pubblicazione: (2025)
di: Kim, Junsol, et al.
Pubblicazione: (2025)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
Exploring Large Language Models and Hierarchical Frameworks for Classification of Large Unstructured Legal Documents
di: Prasad, Nishchal, et al.
Pubblicazione: (2024)
di: Prasad, Nishchal, et al.
Pubblicazione: (2024)
Do Large Language Models Mirror Cognitive Language Processing?
di: Ren, Yuqi, et al.
Pubblicazione: (2024)
di: Ren, Yuqi, et al.
Pubblicazione: (2024)
Hierarchical Memorization in Large Language Models: Evidence from Citation Generation
di: Niimi, Junichiro
Pubblicazione: (2025)
di: Niimi, Junichiro
Pubblicazione: (2025)
Inconsistent Tokenizations Cause Language Models to be Perplexed by Japanese Grammar
di: Gambardella, Andrew, et al.
Pubblicazione: (2025)
di: Gambardella, Andrew, et al.
Pubblicazione: (2025)
Probing the Difficulty Perception Mechanism of Large Language Models
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
di: Wang, Teng, et al.
Pubblicazione: (2025)
di: Wang, Teng, et al.
Pubblicazione: (2025)
Large Language Model for Table Processing: A Survey
di: Lu, Weizheng, et al.
Pubblicazione: (2024)
di: Lu, Weizheng, et al.
Pubblicazione: (2024)
Grammar-Forced Translation of Natural Language to Temporal Logic using LLMs
di: English, William, et al.
Pubblicazione: (2025)
di: English, William, et al.
Pubblicazione: (2025)
Genshin: General Shield for Natural Language Processing with Large Language Models
di: Peng, Xiao, et al.
Pubblicazione: (2024)
di: Peng, Xiao, et al.
Pubblicazione: (2024)
Hierarchical Federated Unlearning for Large Language Models
di: Zhong, Yisheng, et al.
Pubblicazione: (2025)
di: Zhong, Yisheng, et al.
Pubblicazione: (2025)
Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2024)
di: Ma, Rachel, et al.
Pubblicazione: (2024)
Advancing Harmful Content Detection in Organizational Research: Integrating Large Language Models with Elo Rating System
di: Akben, Mustafa, et al.
Pubblicazione: (2025)
di: Akben, Mustafa, et al.
Pubblicazione: (2025)
Efficient Attention Mechanisms for Large Language Models: A Survey
di: Sun, Yutao, et al.
Pubblicazione: (2025)
di: Sun, Yutao, et al.
Pubblicazione: (2025)
Context-Aware Semantic Recomposition Mechanism for Large Language Models
di: Katrix, Richard, et al.
Pubblicazione: (2025)
di: Katrix, Richard, et al.
Pubblicazione: (2025)
Modeling Hierarchical Thinking in Large Reasoning Models
di: Shahariar, G M, et al.
Pubblicazione: (2025)
di: Shahariar, G M, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026) -
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026) -
Prompt Injection as Role Confusion
di: Ye, Charles, et al.
Pubblicazione: (2026) -
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2025) -
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
di: Ma, Rachel, et al.
Pubblicazione: (2026)