ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Hanpeng, Li, Yaqian, Wang, Zidan, Zhang, Shuoxi, Zhao, Zonglin, Bo, Zihao, Takezoe, Rinyoichi, Long, Kaiwen, He, Kun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding
par: Liu, Hanpeng, et autres
Publié: (2026)
par: Liu, Hanpeng, et autres
Publié: (2026)
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
par: Takezoe, Rinyoichi, et autres
Publié: (2026)
par: Takezoe, Rinyoichi, et autres
Publié: (2026)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
par: Liu, Hanpeng, et autres
Publié: (2026)
par: Liu, Hanpeng, et autres
Publié: (2026)
SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
par: Zhao, Yanxiao, et autres
Publié: (2025)
par: Zhao, Yanxiao, et autres
Publié: (2025)
SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs
par: Bo, Zi-Hao, et autres
Publié: (2026)
par: Bo, Zi-Hao, et autres
Publié: (2026)
You Only Need Less Attention at Each Stage in Vision Transformers
par: Zhang, Shuoxi, et autres
Publié: (2024)
par: Zhang, Shuoxi, et autres
Publié: (2024)
QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression
par: Li, Zhongyang, et autres
Publié: (2026)
par: Li, Zhongyang, et autres
Publié: (2026)
Siamese Transformer Networks for Few-shot Image Classification
par: Jiang, Weihao, et autres
Publié: (2024)
par: Jiang, Weihao, et autres
Publié: (2024)
Neural Collapse Inspired Knowledge Distillation
par: Zhang, Shuoxi, et autres
Publié: (2024)
par: Zhang, Shuoxi, et autres
Publié: (2024)
Enhancing Pre-Trained Model-Based Class-Incremental Learning through Neural Collapse
par: He, Kun, et autres
Publié: (2025)
par: He, Kun, et autres
Publié: (2025)
Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training
par: Qiu, Longtian, et autres
Publié: (2024)
par: Qiu, Longtian, et autres
Publié: (2024)
Hybrid Fusion: One-Minute Efficient Training for Zero-Shot Cross-Domain Image Fusion
par: Zhang, Ran, et autres
Publié: (2026)
par: Zhang, Ran, et autres
Publié: (2026)
Projectively Wakamatsu Tilting Modules over One-Point Extensions
par: Liu, Dajun, et autres
Publié: (2026)
par: Liu, Dajun, et autres
Publié: (2026)
TAGA: Text-Attributed Graph Self-Supervised Learning by Synergizing Graph and Text Mutual Transformations
par: Zhang, Zheng, et autres
Publié: (2024)
par: Zhang, Zheng, et autres
Publié: (2024)
An Expert is Worth One Token: Synergizing Multiple Expert LLMs as Generalist via Expert Token Routing
par: Chai, Ziwei, et autres
Publié: (2024)
par: Chai, Ziwei, et autres
Publié: (2024)
Leveraging Contrastive Learning for Enhanced Node Representations in Tokenized Graph Transformers
par: Chen, Jinsong, et autres
Publié: (2024)
par: Chen, Jinsong, et autres
Publié: (2024)
SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment
par: Zhao, Weiren, et autres
Publié: (2026)
par: Zhao, Weiren, et autres
Publié: (2026)
Training-Free Large Model Priors for Multiple-in-One Image Restoration
par: He, Xuanhua, et autres
Publié: (2024)
par: He, Xuanhua, et autres
Publié: (2024)
Rewritable ITO Patterning for Nanophotonics
par: Xinqin Liu, et autres
Publié: (2025)
par: Xinqin Liu, et autres
Publié: (2025)
Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
par: He, Kaichen, et autres
Publié: (2025)
par: He, Kaichen, et autres
Publié: (2025)
Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
par: Kim, Taehoon, et autres
Publié: (2025)
par: Kim, Taehoon, et autres
Publié: (2025)
A System of Multimodal Image‐Text Retrieval Based on Pre‐Trained Models Fusion
par: Qiang Li, et autres
Publié: (2024)
par: Qiang Li, et autres
Publié: (2024)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier
par: Yang, Zonglin, et autres
Publié: (2026)
par: Yang, Zonglin, et autres
Publié: (2026)
CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation
par: Chen, ZhenQi, et autres
Publié: (2025)
par: Chen, ZhenQi, et autres
Publié: (2025)
An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2024)
par: Hu, Zizhao, et autres
Publié: (2024)
HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment
par: Chen, Wenzhi, et autres
Publié: (2026)
par: Chen, Wenzhi, et autres
Publié: (2026)
Optimizing RLHF Training for Large Language Models with Stage Fusion
par: Zhong, Yinmin, et autres
Publié: (2024)
par: Zhong, Yinmin, et autres
Publié: (2024)
Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model
par: Chen, Hongxu, et autres
Publié: (2025)
par: Chen, Hongxu, et autres
Publié: (2025)
ZeroPur: Succinct Training-Free Adversarial Purification
par: Liu, Erhu, et autres
Publié: (2024)
par: Liu, Erhu, et autres
Publié: (2024)
Enhancing Time Series Forecasting via Multi-Level Text Alignment with LLMs
par: Zhao, Taibiao, et autres
Publié: (2025)
par: Zhao, Taibiao, et autres
Publié: (2025)
ISMAF: Intrinsic-Social Modality Alignment and Fusion for Multimodal Rumor Detection
par: Yu, Zihao, et autres
Publié: (2025)
par: Yu, Zihao, et autres
Publié: (2025)
TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
par: Baek, Kanghyun, et autres
Publié: (2025)
par: Baek, Kanghyun, et autres
Publié: (2025)
SAFNet: Selective Alignment Fusion Network for Efficient HDR Imaging
par: Kong, Lingtong, et autres
Publié: (2024)
par: Kong, Lingtong, et autres
Publié: (2024)
Nonreciprocal and temperature-tunable light absorption in AlAs/ITO/GaAs Hybrid Metasurfaces
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Language-Image Alignment with Fixed Text Encoders
par: Yang, Jingfeng, et autres
Publié: (2025)
par: Yang, Jingfeng, et autres
Publié: (2025)
ICE-closed subcategories and epibricks over one-point extensions
par: Li, Xin, et autres
Publié: (2024)
par: Li, Xin, et autres
Publié: (2024)
Training-free Editioning of Text-to-Image Models
par: Wang, Jinqi, et autres
Publié: (2024)
par: Wang, Jinqi, et autres
Publié: (2024)
Knowledge-Guided Brain Tumor Segmentation via Synchronized Visual-Semantic-Topological Prior Fusion
par: Zhang, Mingda, et autres
Publié: (2025)
par: Zhang, Mingda, et autres
Publié: (2025)
Correction to “Photoactivated Trifunctional Platinum Nanobiotics for Precise Synergism of Multiple Antibacterial Modes”
par: Tian Deng, et autres
Publié: (2024)
par: Tian Deng, et autres
Publié: (2024)
Documents similaires
-
iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding
par: Liu, Hanpeng, et autres
Publié: (2026) -
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
par: Takezoe, Rinyoichi, et autres
Publié: (2026) -
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
par: Liu, Hanpeng, et autres
Publié: (2026) -
SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
par: Zhao, Yanxiao, et autres
Publié: (2025) -
SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs
par: Bo, Zi-Hao, et autres
Publié: (2026)