Suchergebnisse - Han, Jiaming
- Treffer 1 - 19 von 19
-
1
Multimodal Long Video Modeling Based on Temporal Dynamic Context Autoría: Hao, Haoran, Han, Jiaming, Zhang, Yiyuan, Yue, Xiangyu
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
2
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing Autoría: Zhu, Zifeng, Han, Jiaming, Zhao, Jiaxiang, Luo, Minnan, Yue, Xiangyu
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
3
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models Autoría: Hao, Haoran, Han, Jiaming, Li, Changsheng, Li, Yu-Feng, Yue, Xiangyu
Veröffentlicht 2024Fuente: arXivTipo de material: PreprintAcceso al recurso -
4
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation Autoría: Feng, Yunhai, Han, Jiaming, Yang, Zhuoran, Yue, Xiangyu, Levine, Sergey, Luo, Jianlan
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
5
ScreenCoder: Advancing Visual-to-Code Generation for Front-End Automation via Modular Multimodal Agents Autoría: Jiang, Yilei, Zheng, Yaozhi, Wan, Yuxuan, Han, Jiaming, Wang, Qunzhong, Lyu, Michael R., Yue, Xiangyu
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
6
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms Autoría: Yan, Shilin, Han, Jiaming, Tsai, Joey, Xue, Hongwei, Fang, Rongyao, Hong, Lingyi, Guo, Ziyu, Zhang, Ray
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
7
OneLLM: One Framework to Align All Modalities with Language Autoría: Han, Jiaming, Gong, Kaixiong, Zhang, Yiyuan, Wang, Jiaqi, Zhang, Kaipeng, Lin, Dahua, Qiao, Yu, Gao, Peng, Yue, Xiangyu
Veröffentlicht 2023Fuente: arXivTipo de material: PreprintAcceso al recurso -
8
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations Autoría: Han, Jiaming, Chen, Hao, Zhao, Yang, Wang, Hanyu, Zhao, Qi, Yang, Ziyan, He, Hao, Yue, Xiangyu, Jiang, Lu
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
9
Growing Visual Generative Capacity for Pre-Trained MLLMs Autoría: Wang, Hanyu, Han, Jiaming, Yang, Ziyan, Zhao, Qi, Lin, Shanchuan, Yue, Xiangyu, Shrivastava, Abhinav, Yang, Zhenheng, Chen, Hao
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
10
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria Autoría: Tian, Juanxi, Liu, Fengyuan, Han, Jiaming, Jiang, Yilei, Wu, Yongliang, Liu, Yesheng, Li, Haodong, Xu, Furong, Li, Wanhua
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
11
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention Autoría: Zhang, Renrui, Han, Jiaming, Liu, Chris, Gao, Peng, Zhou, Aojun, Hu, Xiangfei, Yan, Shilin, Lu, Pan, Li, Hongsheng, Qiao, Yu
Veröffentlicht 2023Fuente: arXivTipo de material: PreprintAcceso al recurso -
12
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection Autoría: Ma, Ruize, Cai, Minghong, Jiang, Yilei, Han, Jiaming, Feng, Yi, Tan, Yingshui, Zhu, Xiaoyong, Zhang, Bo, Zheng, Bo, Yue, Xiangyu
Veröffentlicht 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
13
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens Autoría: Wang, Yuqing, Ma, Chuofan, Lin, Zhijie, Teng, Yao, Yu, Lijun, Wang, Shuai, Han, Jiaming, Feng, Jiashi, Jiang, Yi, Liu, Xihui
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
14
BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion Autoría: Zhuang, Shaobin, Ai, Yuang, Han, Jiaming, Li, Xiaohui, Huang, Huaibo, Yue, Xiangyu, Hu, Xuefeng, Xu, Kun, Wang, Yali, Chen, Hao
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
15
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information? Autoría: Gong, Kaixiong, Feng, Kaituo, Li, Bohao, Wang, Yibing, Cheng, Mofan, Yang, Shijia, Han, Jiaming, Wang, Benyou, Bai, Yutong, Yang, Zhuoran, Yue, Xiangyu
Veröffentlicht 2024Fuente: arXivTipo de material: PreprintAcceso al recurso -
16
BitDance: Scaling Autoregressive Generative Models with Binary Tokens Autoría: Ai, Yuang, Han, Jiaming, Zhuang, Shaobin, Mao, Weijia, Hu, Xuefeng, Yang, Ziyan, Yang, Zhenheng, Wang, Yali, Huang, Huaibo, Yue, Xiangyu, Chen, Hao
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
17
OpenGame: Open Agentic Coding for Games Autoría: Jiang, Yilei, Hu, Jinyuan, Xiao, Qianyin, Zheng, Yaozhi, Ma, Ruize, Feng, Kaituo, Han, Jiaming, Peng, Tianshuo, Fan, Kaixuan, Zhang, Manyuan, Yue, Xiangyu
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
18
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition Autoría: Chen, Yanyu, Jiang, Jiyue, Yu, Dianzhi, Wu, Zheng, Liu, Jiahong, Han, Jiaming, Guo, Xiao, Qi, Jinhu, Li, Yu, Zhang, Yifei, King, Irwin
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso -
19
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model Autoría: Zhuang, Shaobin, Ai, Yuang, Han, Jiaming, Mao, Weijia, Li, Xiaohui, Wang, Fangyikang, Wang, Xiao, Li, Yan, Lin, Shanchuan, Xu, Kun, Yang, Zhenheng, Huang, Huaibo, Yue, Xiangyu, Chen, Hao, Wang, Yali
Veröffentlicht 2026Fuente: arXivTipo de material: PreprintAcceso al recurso