Guardado en:
| Autores principales: | Chen, Marco, Qi, Xianbiao, He, Yelin, Ye, Jiaquan, Xiao, Rong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.01212 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD
por: Qi, Xianbiao, et al.
Publicado: (2025)
por: Qi, Xianbiao, et al.
Publicado: (2025)
Taming Transformer Without Using Learning Rate Warmup
por: Qi, Xianbiao, et al.
Publicado: (2025)
por: Qi, Xianbiao, et al.
Publicado: (2025)
Delving into Muon and Beyond: Deep Analysis and Extensions
por: Qi, Xianbiao, et al.
Publicado: (2026)
por: Qi, Xianbiao, et al.
Publicado: (2026)
BodyShapeGPT: SMPL Body Shape Manipulation with LLMs
por: Árbol, Baldomero R., et al.
Publicado: (2024)
por: Árbol, Baldomero R., et al.
Publicado: (2024)
Examining the Robustness of Homogeneity Bias to Hyperparameter Adjustments in GPT-4
por: Lee, Messi H. J.
Publicado: (2025)
por: Lee, Messi H. J.
Publicado: (2025)
Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering
por: Beliaev, Mark, et al.
Publicado: (2025)
por: Beliaev, Mark, et al.
Publicado: (2025)
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
por: Li, Yanghao, et al.
Publicado: (2025)
por: Li, Yanghao, et al.
Publicado: (2025)
Simple ReFlow: Improved Techniques for Fast Flow Models
por: Kim, Beomsu, et al.
Publicado: (2024)
por: Kim, Beomsu, et al.
Publicado: (2024)
Exploring a Principled Framework for Deep Subspace Clustering
por: Meng, Xianghan, et al.
Publicado: (2025)
por: Meng, Xianghan, et al.
Publicado: (2025)
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
por: Zhan, Jun, et al.
Publicado: (2024)
por: Zhan, Jun, et al.
Publicado: (2024)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
por: Chen, Junying, et al.
Publicado: (2025)
por: Chen, Junying, et al.
Publicado: (2025)
DreamTime: An Improved Optimization Strategy for Diffusion-Guided 3D Generation
por: Huang, Yukun, et al.
Publicado: (2023)
por: Huang, Yukun, et al.
Publicado: (2023)
DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning
por: Zala, Abhay, et al.
Publicado: (2023)
por: Zala, Abhay, et al.
Publicado: (2023)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
por: Gado, Mohamed, et al.
Publicado: (2025)
por: Gado, Mohamed, et al.
Publicado: (2025)
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
por: Lin, Han, et al.
Publicado: (2023)
por: Lin, Han, et al.
Publicado: (2023)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Harnessing GPT-4V(ision) for Insurance: A Preliminary Exploration
por: Lin, Chenwei, et al.
Publicado: (2024)
por: Lin, Chenwei, et al.
Publicado: (2024)
Contrasting with Symile: Simple Model-Agnostic Representation Learning for Unlimited Modalities
por: Saporta, Adriel, et al.
Publicado: (2024)
por: Saporta, Adriel, et al.
Publicado: (2024)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
Transformers without Normalization
por: Zhu, Jiachen, et al.
Publicado: (2025)
por: Zhu, Jiachen, et al.
Publicado: (2025)
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
por: Han, Zongbo, et al.
Publicado: (2024)
por: Han, Zongbo, et al.
Publicado: (2024)
MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors
por: Tang, Yuan, et al.
Publicado: (2024)
por: Tang, Yuan, et al.
Publicado: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
GPT-4o System Card
por: OpenAI, et al.
Publicado: (2024)
por: OpenAI, et al.
Publicado: (2024)
TrackletGPT: A Language-like GPT Framework for White Matter Tract Segmentation
por: Goel, Anoushkrit, et al.
Publicado: (2026)
por: Goel, Anoushkrit, et al.
Publicado: (2026)
Global Pre-fixing, Local Adjusting: A Simple yet Effective Contrastive Strategy for Continual Learning
por: Tang, Jia, et al.
Publicado: (2025)
por: Tang, Jia, et al.
Publicado: (2025)
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
por: Xiao, Han, et al.
Publicado: (2025)
por: Xiao, Han, et al.
Publicado: (2025)
A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5
por: Ma, Xingjun, et al.
Publicado: (2026)
por: Ma, Xingjun, et al.
Publicado: (2026)
Stronger Normalization-Free Transformers
por: Chen, Mingzhi, et al.
Publicado: (2025)
por: Chen, Mingzhi, et al.
Publicado: (2025)
Simple Vision-Language Math Reasoning via Rendered Text
por: Skripkin, Matvey, et al.
Publicado: (2025)
por: Skripkin, Matvey, et al.
Publicado: (2025)
Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View
por: Song, Zijia, et al.
Publicado: (2024)
por: Song, Zijia, et al.
Publicado: (2024)
Sparsity Hurts: Simple Linear Adapter Can Boost Generalized Category Discovery
por: Ye, Bo, et al.
Publicado: (2026)
por: Ye, Bo, et al.
Publicado: (2026)
Improving Language Understanding from Screenshots
por: Gao, Tianyu, et al.
Publicado: (2024)
por: Gao, Tianyu, et al.
Publicado: (2024)
LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
por: Le-Duc, Khai, et al.
Publicado: (2024)
por: Le-Duc, Khai, et al.
Publicado: (2024)
SUTrack: Towards Simple and Unified Single Object Tracking
por: Chen, Xin, et al.
Publicado: (2024)
por: Chen, Xin, et al.
Publicado: (2024)
Till the Layers Collapse: Compressing a Deep Neural Network through the Lenses of Batch Normalization Layers
por: Liao, Zhu, et al.
Publicado: (2024)
por: Liao, Zhu, et al.
Publicado: (2024)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
por: Huang, Wei, et al.
Publicado: (2025)
por: Huang, Wei, et al.
Publicado: (2025)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
por: Yuan, Zhengqing, et al.
Publicado: (2023)
por: Yuan, Zhengqing, et al.
Publicado: (2023)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Ejemplares similares
-
DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD
por: Qi, Xianbiao, et al.
Publicado: (2025) -
Taming Transformer Without Using Learning Rate Warmup
por: Qi, Xianbiao, et al.
Publicado: (2025) -
Delving into Muon and Beyond: Deep Analysis and Extensions
por: Qi, Xianbiao, et al.
Publicado: (2026) -
BodyShapeGPT: SMPL Body Shape Manipulation with LLMs
por: Árbol, Baldomero R., et al.
Publicado: (2024) -
Examining the Robustness of Homogeneity Bias to Hyperparameter Adjustments in GPT-4
por: Lee, Messi H. J.
Publicado: (2025)