Guardado en:
| Autores principales: | Bhaskar, Adithya, Ye, Xi, Chen, Danqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.20357 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
por: Bhaskar, Adithya, et al.
Publicado: (2024)
por: Bhaskar, Adithya, et al.
Publicado: (2024)
Continual Memorization of Factoids in Language Models
por: Chen, Howard, et al.
Publicado: (2024)
por: Chen, Howard, et al.
Publicado: (2024)
Improving Language Understanding from Screenshots
por: Gao, Tianyu, et al.
Publicado: (2024)
por: Gao, Tianyu, et al.
Publicado: (2024)
Finding Transformer Circuits with Edge Pruning
por: Bhaskar, Adithya, et al.
Publicado: (2024)
por: Bhaskar, Adithya, et al.
Publicado: (2024)
Extracting Rule-based Descriptions of Attention Features in Transformers
por: Friedman, Dan, et al.
Publicado: (2025)
por: Friedman, Dan, et al.
Publicado: (2025)
Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs?
por: Bhaskar, Adithya, et al.
Publicado: (2025)
por: Bhaskar, Adithya, et al.
Publicado: (2025)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
por: Razin, Noam, et al.
Publicado: (2024)
por: Razin, Noam, et al.
Publicado: (2024)
DySCO: Dynamic Attention-Scaling Decoding for Long-Context Language Models
por: Ye, Xi, et al.
Publicado: (2026)
por: Ye, Xi, et al.
Publicado: (2026)
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
por: Lee, Yoonsang, et al.
Publicado: (2026)
por: Lee, Yoonsang, et al.
Publicado: (2026)
Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
por: He, Yinghui, et al.
Publicado: (2026)
por: He, Yinghui, et al.
Publicado: (2026)
Long-Context Language Modeling with Parallel Context Encoding
por: Yen, Howard, et al.
Publicado: (2024)
por: Yen, Howard, et al.
Publicado: (2024)
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
por: Ye, Xi, et al.
Publicado: (2025)
por: Ye, Xi, et al.
Publicado: (2025)
Query-Focused Retrieval Heads Improve Long-Context Reasoning and Re-ranking
por: Zhang, Wuwei, et al.
Publicado: (2025)
por: Zhang, Wuwei, et al.
Publicado: (2025)
How to Train Long-Context Language Models (Effectively)
por: Gao, Tianyu, et al.
Publicado: (2024)
por: Gao, Tianyu, et al.
Publicado: (2024)
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
QuRating: Selecting High-Quality Data for Training Language Models
por: Wettig, Alexander, et al.
Publicado: (2024)
por: Wettig, Alexander, et al.
Publicado: (2024)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
por: Zhong, Zexuan, et al.
Publicado: (2024)
por: Zhong, Zexuan, et al.
Publicado: (2024)
Skip-Thinking: Chunk-wise Chain-of-Thought Distillation Enable Smaller Language Models to Reason Better and Faster
por: Chen, Xiao, et al.
Publicado: (2025)
por: Chen, Xiao, et al.
Publicado: (2025)
Metadata Conditioning Accelerates Language Model Pre-training
por: Gao, Tianyu, et al.
Publicado: (2025)
por: Gao, Tianyu, et al.
Publicado: (2025)
MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop Questions
por: Zhong, Zexuan, et al.
Publicado: (2023)
por: Zhong, Zexuan, et al.
Publicado: (2023)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
por: Xia, Mengzhou, et al.
Publicado: (2023)
por: Xia, Mengzhou, et al.
Publicado: (2023)
Evaluating Large Language Models at Evaluating Instruction Following
por: Zeng, Zhiyuan, et al.
Publicado: (2023)
por: Zeng, Zhiyuan, et al.
Publicado: (2023)
Chatting with Images for Introspective Visual Thinking
por: Wu, Junfei, et al.
Publicado: (2026)
por: Wu, Junfei, et al.
Publicado: (2026)
MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning
por: Xi, Ningyuan, et al.
Publicado: (2024)
por: Xi, Ningyuan, et al.
Publicado: (2024)
SimPO: Simple Preference Optimization with a Reference-Free Reward
por: Meng, Yu, et al.
Publicado: (2024)
por: Meng, Yu, et al.
Publicado: (2024)
Better Language Model-Based Judging Reward Modeling through Scaling Comprehension Boundaries
por: Ning, Meiling, et al.
Publicado: (2025)
por: Ning, Meiling, et al.
Publicado: (2025)
Fine-Tuning Language Models with Just Forward Passes
por: Malladi, Sadhika, et al.
Publicado: (2023)
por: Malladi, Sadhika, et al.
Publicado: (2023)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
por: Chen, Yanjun, et al.
Publicado: (2024)
por: Chen, Yanjun, et al.
Publicado: (2024)
Think Together and Work Better: Combining Humans' and LLMs' Think-Aloud Outcomes for Effective Text Evaluation
por: Chu, SeongYeub, et al.
Publicado: (2024)
por: Chu, SeongYeub, et al.
Publicado: (2024)
Language Models as Critical Thinking Tools: A Case Study of Philosophers
por: Ye, Andre, et al.
Publicado: (2024)
por: Ye, Andre, et al.
Publicado: (2024)
On the Thinking-Language Modeling Gap in Large Language Models
por: Liu, Chenxi, et al.
Publicado: (2025)
por: Liu, Chenxi, et al.
Publicado: (2025)
FuseChat: Knowledge Fusion of Chat Models
por: Wan, Fanqi, et al.
Publicado: (2024)
por: Wan, Fanqi, et al.
Publicado: (2024)
Interpretability Illusions in the Generalization of Simplified Models
por: Friedman, Dan, et al.
Publicado: (2023)
por: Friedman, Dan, et al.
Publicado: (2023)
Achieving Tokenizer Flexibility in Language Models through Heuristic Adaptation and Supertoken Learning
por: Sharthak, Shaurya, et al.
Publicado: (2025)
por: Sharthak, Shaurya, et al.
Publicado: (2025)
Learning to Self-Verify Makes Language Models Better Reasoners
por: Chen, Yuxin, et al.
Publicado: (2026)
por: Chen, Yuxin, et al.
Publicado: (2026)
Conan-embedding: General Text Embedding with More and Better Negative Samples
por: Li, Shiyu, et al.
Publicado: (2024)
por: Li, Shiyu, et al.
Publicado: (2024)
Representing Rule-based Chatbots with Transformers
por: Friedman, Dan, et al.
Publicado: (2024)
por: Friedman, Dan, et al.
Publicado: (2024)
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
por: Chen, Howard, et al.
Publicado: (2025)
por: Chen, Howard, et al.
Publicado: (2025)
HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly
por: Yen, Howard, et al.
Publicado: (2024)
por: Yen, Howard, et al.
Publicado: (2024)
Supervised Knowledge Makes Large Language Models Better In-context Learners
por: Yang, Linyi, et al.
Publicado: (2023)
por: Yang, Linyi, et al.
Publicado: (2023)
Ejemplares similares
-
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
por: Bhaskar, Adithya, et al.
Publicado: (2024) -
Continual Memorization of Factoids in Language Models
por: Chen, Howard, et al.
Publicado: (2024) -
Improving Language Understanding from Screenshots
por: Gao, Tianyu, et al.
Publicado: (2024) -
Finding Transformer Circuits with Edge Pruning
por: Bhaskar, Adithya, et al.
Publicado: (2024) -
Extracting Rule-based Descriptions of Attention Features in Transformers
por: Friedman, Dan, et al.
Publicado: (2025)