Understanding and Enhancing Mamba-Transformer Hybrids for Memory Recall and Language Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Hyunji, Yu, Wenhao, Zhang, Hongming, Ma, Kaixin, Kim, Jiyeon, Yu, Dong, Seo, Minjoon |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
par: Ma, Junyu, et autres
Publié: (2025)
par: Ma, Junyu, et autres
Publié: (2025)
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
par: Yu, Wenhao, et autres
Publié: (2023)
par: Yu, Wenhao, et autres
Publié: (2023)
Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition
par: Kim, Jiyeon, et autres
Publié: (2024)
par: Kim, Jiyeon, et autres
Publié: (2024)
Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models
par: Kim, Jiyeon, et autres
Publié: (2026)
par: Kim, Jiyeon, et autres
Publié: (2026)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
par: Kim, Jiyeon, et autres
Publié: (2026)
par: Kim, Jiyeon, et autres
Publié: (2026)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
par: Kim, Geewook, et autres
Publié: (2024)
par: Kim, Geewook, et autres
Publié: (2024)
How Well Do Large Language Models Truly Ground?
par: Lee, Hyunji, et autres
Publié: (2023)
par: Lee, Hyunji, et autres
Publié: (2023)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
par: Zhang, Zhisong, et autres
Publié: (2025)
par: Zhang, Zhisong, et autres
Publié: (2025)
LASER: LLM Agent with State-Space Exploration for Web Navigation
par: Ma, Kaixin, et autres
Publié: (2023)
par: Ma, Kaixin, et autres
Publié: (2023)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
par: Won, Yunjae, et autres
Publié: (2025)
par: Won, Yunjae, et autres
Publié: (2025)
KTRL+F: Knowledge-Augmented In-Document Search
par: Oh, Hanseok, et autres
Publié: (2023)
par: Oh, Hanseok, et autres
Publié: (2023)
Rethinking the Role of Proxy Rewards in Language Model Alignment
par: Kim, Sungdong, et autres
Publié: (2024)
par: Kim, Sungdong, et autres
Publié: (2024)
Improving Probability-based Prompt Selection Through Unified Evaluation and Analysis
par: Yang, Sohee, et autres
Publié: (2023)
par: Yang, Sohee, et autres
Publié: (2023)
TSLM: Tree-Structured Language Modeling for Divergent Thinking
par: Kim, Doyoung, et autres
Publié: (2026)
par: Kim, Doyoung, et autres
Publié: (2026)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
par: Jia, Mengzhao, et autres
Publié: (2024)
par: Jia, Mengzhao, et autres
Publié: (2024)
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
par: Hwang, Hyeonbin, et autres
Publié: (2024)
par: Hwang, Hyeonbin, et autres
Publié: (2024)
Understanding Factual Recall in Transformers via Associative Memories
par: Nichani, Eshaan, et autres
Publié: (2024)
par: Nichani, Eshaan, et autres
Publié: (2024)
DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems
par: Zou, Anni, et autres
Publié: (2024)
par: Zou, Anni, et autres
Publié: (2024)
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
par: He, Hongliang, et autres
Publié: (2024)
par: He, Hongliang, et autres
Publié: (2024)
INSTRUCTIR: A Benchmark for Instruction Following of Information Retrieval Models
par: Oh, Hanseok, et autres
Publié: (2024)
par: Oh, Hanseok, et autres
Publié: (2024)
Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
par: Ouyang, Siru, et autres
Publié: (2024)
par: Ouyang, Siru, et autres
Publié: (2024)
Semiparametric Token-Sequence Co-Supervision
par: Lee, Hyunji, et autres
Publié: (2024)
par: Lee, Hyunji, et autres
Publié: (2024)
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
par: He, Hongliang, et autres
Publié: (2024)
par: He, Hongliang, et autres
Publié: (2024)
Retrieval-augmented GUI Agents with Generative Guidelines
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
Aligning Large Language Models by On-Policy Self-Judgment
par: Lee, Sangkyu, et autres
Publié: (2024)
par: Lee, Sangkyu, et autres
Publié: (2024)
Dense X Retrieval: What Retrieval Granularity Should We Use?
par: Chen, Tong, et autres
Publié: (2023)
par: Chen, Tong, et autres
Publié: (2023)
How language models extrapolate outside the training data: A case study in Textualized Gridworld
par: Kim, Doyoung, et autres
Publié: (2024)
par: Kim, Doyoung, et autres
Publié: (2024)
Don't Throw Away Your Pretrained Model
par: Feng, Shangbin, et autres
Publié: (2025)
par: Feng, Shangbin, et autres
Publié: (2025)
DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
par: Jing, Liqiang, et autres
Publié: (2024)
par: Jing, Liqiang, et autres
Publié: (2024)
Lost in the Noise: How Reasoning Models Fail with Contextual Distractors
par: Lee, Seongyun, et autres
Publié: (2026)
par: Lee, Seongyun, et autres
Publié: (2026)
Contrastive and Consistency Learning for Neural Noisy-Channel Model in Spoken Language Understanding
par: Kim, Suyoung, et autres
Publié: (2024)
par: Kim, Suyoung, et autres
Publié: (2024)
Aligning to Thousands of Preferences via System Message Generalization
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions
par: Choi, Minjoon
Publié: (2025)
par: Choi, Minjoon
Publié: (2025)
Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
par: Cui, Sijia, et autres
Publié: (2025)
par: Cui, Sijia, et autres
Publié: (2025)
OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas
par: Wang, Xiaoyang, et autres
Publié: (2025)
par: Wang, Xiaoyang, et autres
Publié: (2025)
Jamba: A Hybrid Transformer-Mamba Language Model
par: Lieber, Opher, et autres
Publié: (2024)
par: Lieber, Opher, et autres
Publié: (2024)
Documents similaires
-
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
par: Lee, Seongyun, et autres
Publié: (2024) -
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
par: Ma, Junyu, et autres
Publié: (2025) -
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
par: Yu, Wenhao, et autres
Publié: (2023) -
Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition
par: Kim, Jiyeon, et autres
Publié: (2024) -
Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models
par: Kim, Jiyeon, et autres
Publié: (2026)