CogVLM: Visual Expert for Pretrained Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Weihan, Lv, Qingsong, Yu, Wenmeng, Hong, Wenyi, Qi, Ji, Wang, Yan, Ji, Junhui, Yang, Zhuoyi, Zhao, Lei, Song, Xixuan, Xu, Jiazheng, Xu, Bin, Li, Juanzi, Dong, Yuxiao, Ding, Ming, Tang, Jie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CogVLM2: Visual Language Models for Image and Video Understanding
von: Hong, Wenyi, et al.
Veröffentlicht: (2024)
von: Hong, Wenyi, et al.
Veröffentlicht: (2024)
CogAgent: A Visual Language Model for GUI Agents
von: Hong, Wenyi, et al.
Veröffentlicht: (2023)
von: Hong, Wenyi, et al.
Veröffentlicht: (2023)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
von: Qi, Ji, et al.
Veröffentlicht: (2024)
von: Qi, Ji, et al.
Veröffentlicht: (2024)
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024)
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024)
CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion
von: Zheng, Wendi, et al.
Veröffentlicht: (2024)
von: Zheng, Wendi, et al.
Veröffentlicht: (2024)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
von: Tian, Yu, et al.
Veröffentlicht: (2024)
von: Tian, Yu, et al.
Veröffentlicht: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
LVBench: An Extreme Long Video Understanding Benchmark
von: Wang, Weihan, et al.
Veröffentlicht: (2024)
von: Wang, Weihan, et al.
Veröffentlicht: (2024)
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model
von: Yang, Zhen, et al.
Veröffentlicht: (2024)
von: Yang, Zhen, et al.
Veröffentlicht: (2024)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
von: Hong, Wenyi, et al.
Veröffentlicht: (2025)
von: Hong, Wenyi, et al.
Veröffentlicht: (2025)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024)
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
von: Qi, Ji, et al.
Veröffentlicht: (2023)
von: Qi, Ji, et al.
Veröffentlicht: (2023)
Extensive Self-Contrast Enables Feedback-Free Language Model Alignment
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
von: Hao, Xixuan, et al.
Veröffentlicht: (2024)
von: Hao, Xixuan, et al.
Veröffentlicht: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
von: Bai, Yushi, et al.
Veröffentlicht: (2024)
von: Bai, Yushi, et al.
Veröffentlicht: (2024)
UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization
von: Yang, Zhen, et al.
Veröffentlicht: (2025)
von: Yang, Zhen, et al.
Veröffentlicht: (2025)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
von: Bai, Yushi, et al.
Veröffentlicht: (2024)
von: Bai, Yushi, et al.
Veröffentlicht: (2024)
Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
von: Sun, Zexu, et al.
Veröffentlicht: (2025)
von: Sun, Zexu, et al.
Veröffentlicht: (2025)
Recurrent Neural Network on PICTURE Model
von: Xu, Weihan
Veröffentlicht: (2024)
von: Xu, Weihan
Veröffentlicht: (2024)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
von: Qi, Ji, et al.
Veröffentlicht: (2025)
von: Qi, Ji, et al.
Veröffentlicht: (2025)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
von: Cheng, Jiale, et al.
Veröffentlicht: (2025)
von: Cheng, Jiale, et al.
Veröffentlicht: (2025)
Generalizing GNNs with Tokenized Mixture of Experts
von: Guo, Xiaoguang, et al.
Veröffentlicht: (2026)
von: Guo, Xiaoguang, et al.
Veröffentlicht: (2026)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
von: Xu, Runsen, et al.
Veröffentlicht: (2024)
von: Xu, Runsen, et al.
Veröffentlicht: (2024)
CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
von: Lv, Yaojia, et al.
Veröffentlicht: (2024)
von: Lv, Yaojia, et al.
Veröffentlicht: (2024)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
von: Peng, Hao, et al.
Veröffentlicht: (2025)
von: Peng, Hao, et al.
Veröffentlicht: (2025)
ADELIE: Aligning Large Language Models on Information Extraction
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
CogDoc: Towards Unified thinking in Documents
von: Xu, Qixin, et al.
Veröffentlicht: (2025)
von: Xu, Qixin, et al.
Veröffentlicht: (2025)
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
von: Kong, Quan, et al.
Veröffentlicht: (2026)
von: Kong, Quan, et al.
Veröffentlicht: (2026)
Thyroid Lobectomy for Unilateral Papillary Thyroid Carcinoma Patients With High‐Volume ( n ≥ 5 ) Central Lymph Node Metastases
von: Guixu Lv, et al.
Veröffentlicht: (2026)
von: Guixu Lv, et al.
Veröffentlicht: (2026)
Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy
von: Deng, Zekai, et al.
Veröffentlicht: (2025)
von: Deng, Zekai, et al.
Veröffentlicht: (2025)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
von: Sun, Kai, et al.
Veröffentlicht: (2024)
von: Sun, Kai, et al.
Veröffentlicht: (2024)
BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
von: Zhan, Qiusi, et al.
Veröffentlicht: (2025)
von: Zhan, Qiusi, et al.
Veröffentlicht: (2025)
TROI: Cross-Subject Pretraining with Sparse Voxel Selection for Enhanced fMRI Visual Decoding
von: Wang, Ziyu, et al.
Veröffentlicht: (2025)
von: Wang, Ziyu, et al.
Veröffentlicht: (2025)
Scaling Dense Event-Stream Pretraining from Visual Foundation Models
von: Chen, Zhiwen, et al.
Veröffentlicht: (2026)
von: Chen, Zhiwen, et al.
Veröffentlicht: (2026)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
von: Xu, Hai-Ming, et al.
Veröffentlicht: (2024)
von: Xu, Hai-Ming, et al.
Veröffentlicht: (2024)
Quantum symmetric pairs via Hall algebras
von: Lu, Ming, et al.
Veröffentlicht: (2025)
von: Lu, Ming, et al.
Veröffentlicht: (2025)
Dynamical study of $T_{ss}$ systems at a chiral quark model
von: Ji, Jiazheng, et al.
Veröffentlicht: (2024)
von: Ji, Jiazheng, et al.
Veröffentlicht: (2024)
StoryWriter: A Multi-Agent Framework for Long Story Generation
von: Xia, Haotian, et al.
Veröffentlicht: (2025)
von: Xia, Haotian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CogVLM2: Visual Language Models for Image and Video Understanding
von: Hong, Wenyi, et al.
Veröffentlicht: (2024) -
CogAgent: A Visual Language Model for GUI Agents
von: Hong, Wenyi, et al.
Veröffentlicht: (2023) -
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
von: Qi, Ji, et al.
Veröffentlicht: (2024) -
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024) -
CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion
von: Zheng, Wendi, et al.
Veröffentlicht: (2024)