Salvato in:
| Autori principali: | Wu, Xiaojun, Zhang, Dixiang, Gan, Ruyi, Lu, Junyu, Wu, Ziwei, Sun, Renliang, Zhang, Jiaxing, Zhang, Pingjian, Song, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2401.14688 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
di: Lu, Junyu, et al.
Pubblicazione: (2023)
di: Lu, Junyu, et al.
Pubblicazione: (2023)
Ziya2: Data-centric Learning is All LLMs Need
di: Gan, Ruyi, et al.
Pubblicazione: (2023)
di: Gan, Ruyi, et al.
Pubblicazione: (2023)
ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences
di: Tian, Yuanhe, et al.
Pubblicazione: (2023)
di: Tian, Yuanhe, et al.
Pubblicazione: (2023)
Taiyi: A Bilingual Fine-Tuned Large Language Model for Diverse Biomedical Tasks
di: Luo, Ling, et al.
Pubblicazione: (2023)
di: Luo, Ling, et al.
Pubblicazione: (2023)
Fostering Natural Conversation in Large Language Models with NICO: a Natural Interactive COnversation dataset
di: Sun, Renliang, et al.
Pubblicazione: (2024)
di: Sun, Renliang, et al.
Pubblicazione: (2024)
CAPE: A Chinese Dataset for Appraisal-based Emotional Generation using Large Language Models
di: Liu, June M., et al.
Pubblicazione: (2024)
di: Liu, June M., et al.
Pubblicazione: (2024)
Solving Math Word Problems via Cooperative Reasoning induced Language Models
di: Zhu, Xinyu, et al.
Pubblicazione: (2022)
di: Zhu, Xinyu, et al.
Pubblicazione: (2022)
EvolveDirector: Approaching Advanced Text-to-Image Generation with Large Vision-Language Models
di: Zhao, Rui, et al.
Pubblicazione: (2024)
di: Zhao, Rui, et al.
Pubblicazione: (2024)
PGDA-KGQA: A Prompt-Guided Generative Framework with Multiple Data Augmentation Strategies for Knowledge Graph Question Answering
di: Zhou, Xiujun, et al.
Pubblicazione: (2025)
di: Zhou, Xiujun, et al.
Pubblicazione: (2025)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
di: Lu, Junyu, et al.
Pubblicazione: (2025)
di: Lu, Junyu, et al.
Pubblicazione: (2025)
M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining
di: Guo, Qingpei, et al.
Pubblicazione: (2024)
di: Guo, Qingpei, et al.
Pubblicazione: (2024)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
Vision-Language Models for Vision Tasks: A Survey
di: Zhang, Jingyi, et al.
Pubblicazione: (2023)
di: Zhang, Jingyi, et al.
Pubblicazione: (2023)
Taiyi: A high-performance CKKS accelerator for Practical Fully Homomorphic Encryption
di: Fan, Shengyu, et al.
Pubblicazione: (2024)
di: Fan, Shengyu, et al.
Pubblicazione: (2024)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
GTSD: Generative Text Steganography Based on Diffusion Model
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2024)
di: Zhang, Huixuan, et al.
Pubblicazione: (2024)
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
di: Lan, Mengcheng, et al.
Pubblicazione: (2025)
di: Lan, Mengcheng, et al.
Pubblicazione: (2025)
Global-Recent Semantic Reasoning on Dynamic Text-Attributed Graphs with Large Language Models
di: Wang, Yunan, et al.
Pubblicazione: (2025)
di: Wang, Yunan, et al.
Pubblicazione: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
di: Song, Xiujie, et al.
Pubblicazione: (2024)
di: Song, Xiujie, et al.
Pubblicazione: (2024)
FitText: Evolving Agent Tool Ecologies via Memetic Retrieval
di: Zheng, Kyle, et al.
Pubblicazione: (2026)
di: Zheng, Kyle, et al.
Pubblicazione: (2026)
G2rammar: Bilingual Grammar Modeling for Enhanced Text-attributed Graph Learning
di: Zheng, Heng, et al.
Pubblicazione: (2025)
di: Zheng, Heng, et al.
Pubblicazione: (2025)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
di: Shin, Dongjae, et al.
Pubblicazione: (2024)
di: Shin, Dongjae, et al.
Pubblicazione: (2024)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
di: Zheng, Jinzhi, et al.
Pubblicazione: (2024)
di: Zheng, Jinzhi, et al.
Pubblicazione: (2024)
Rufy3 Knockdown Induces PANoptosis Through MAP4 / CDK1 Axis to Inhibit Colorectal Cancer Growth: Evidence From In Vitro and In Vivo Models
di: Ruyi Xie, et al.
Pubblicazione: (2025)
di: Ruyi Xie, et al.
Pubblicazione: (2025)
Disentangled Representation Learning with Large Language Models for Text-Attributed Graphs
di: Qin, Yijian, et al.
Pubblicazione: (2023)
di: Qin, Yijian, et al.
Pubblicazione: (2023)
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
di: Yu, Haodong, et al.
Pubblicazione: (2026)
di: Yu, Haodong, et al.
Pubblicazione: (2026)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models
di: Wu, Tong, et al.
Pubblicazione: (2024)
di: Wu, Tong, et al.
Pubblicazione: (2024)
Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models
di: Wu, Zongyu, et al.
Pubblicazione: (2025)
di: Wu, Zongyu, et al.
Pubblicazione: (2025)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
di: Wu, Xiaojun, et al.
Pubblicazione: (2024)
di: Wu, Xiaojun, et al.
Pubblicazione: (2024)
CELLO: Causal Evaluation of Large Vision-Language Models
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists
di: Gan, Yulu, et al.
Pubblicazione: (2023)
di: Gan, Yulu, et al.
Pubblicazione: (2023)
Decision Support under Prediction-Induced Censoring
di: Chen, Yan, et al.
Pubblicazione: (2026)
di: Chen, Yan, et al.
Pubblicazione: (2026)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
di: Yang, Jiaxing, et al.
Pubblicazione: (2025)
di: Yang, Jiaxing, et al.
Pubblicazione: (2025)
Language Rectified Flow: Advancing Diffusion Language Generation with Probabilistic Flows
di: Zhang, Shujian, et al.
Pubblicazione: (2024)
di: Zhang, Shujian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
di: Lu, Junyu, et al.
Pubblicazione: (2023) -
Ziya2: Data-centric Learning is All LLMs Need
di: Gan, Ruyi, et al.
Pubblicazione: (2023) -
ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences
di: Tian, Yuanhe, et al.
Pubblicazione: (2023) -
Taiyi: A Bilingual Fine-Tuned Large Language Model for Diverse Biomedical Tasks
di: Luo, Ling, et al.
Pubblicazione: (2023) -
Fostering Natural Conversation in Large Language Models with NICO: a Natural Interactive COnversation dataset
di: Sun, Renliang, et al.
Pubblicazione: (2024)