GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Shilong, Sun, Peize, Chen, Shoufa, Xiao, Min, Shao, Wenqi, Zhang, Wenwei, Liu, Yu, Chen, Kai, Luo, Ping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PixelFlow: Pixel-Space Generative Models with Flow
di: Chen, Shoufa, et al.
Pubblicazione: (2025)
di: Chen, Shoufa, et al.
Pubblicazione: (2025)
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
di: Sun, Peize, et al.
Pubblicazione: (2024)
di: Sun, Peize, et al.
Pubblicazione: (2024)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
Multi-RoI Human Mesh Recovery with Camera Consistency and Contrastive Losses
di: Nie, Yongwei, et al.
Pubblicazione: (2024)
di: Nie, Yongwei, et al.
Pubblicazione: (2024)
DetVPCC: RoI-based Point Cloud Sequence Compression for 3D Object Detection
di: Yan, Mingxuan, et al.
Pubblicazione: (2025)
di: Yan, Mingxuan, et al.
Pubblicazione: (2025)
Visual Instruction Tuning with Chain of Region-of-Interest
di: Chen, Yixin, et al.
Pubblicazione: (2025)
di: Chen, Yixin, et al.
Pubblicazione: (2025)
FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation
di: Zhang, Shilong, et al.
Pubblicazione: (2025)
di: Zhang, Shilong, et al.
Pubblicazione: (2025)
Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
di: Shi, Yuheng, et al.
Pubblicazione: (2025)
di: Shi, Yuheng, et al.
Pubblicazione: (2025)
Compression Metadata-assisted RoI Extraction and Adaptive Inference for Efficient Video Analytics
di: Wang, Chengzhi, et al.
Pubblicazione: (2025)
di: Wang, Chengzhi, et al.
Pubblicazione: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
di: Chen, Zewen, et al.
Pubblicazione: (2024)
di: Chen, Zewen, et al.
Pubblicazione: (2024)
LangGrasp: Leveraging Fine-Tuned LLMs for Language Interactive Robot Grasping with Ambiguous Instructions
di: Lin, Yunhan, et al.
Pubblicazione: (2025)
di: Lin, Yunhan, et al.
Pubblicazione: (2025)
Tool-RoCo: An Agent-as-Tool Self-organization Large Language Model Benchmark in Multi-robot Cooperation
di: Zhang, Ke, et al.
Pubblicazione: (2025)
di: Zhang, Ke, et al.
Pubblicazione: (2025)
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
di: Chen, Zehui, et al.
Pubblicazione: (2024)
di: Chen, Zehui, et al.
Pubblicazione: (2024)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
GraphGPT: Graph Instruction Tuning for Large Language Models
di: Tang, Jiabin, et al.
Pubblicazione: (2023)
di: Tang, Jiabin, et al.
Pubblicazione: (2023)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
di: Zhang, Jinrui, et al.
Pubblicazione: (2024)
di: Zhang, Jinrui, et al.
Pubblicazione: (2024)
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
di: Hu, Mengkang, et al.
Pubblicazione: (2024)
di: Hu, Mengkang, et al.
Pubblicazione: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Towards Building the Federated GPT: Federated Instruction Tuning
di: Zhang, Jianyi, et al.
Pubblicazione: (2023)
di: Zhang, Jianyi, et al.
Pubblicazione: (2023)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
ControlAR: Controllable Image Generation with Autoregressive Models
di: Li, Zongming, et al.
Pubblicazione: (2024)
di: Li, Zongming, et al.
Pubblicazione: (2024)
Instruction Tuning for Large Language Models: A Survey
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding
di: Yang, Jiayan, et al.
Pubblicazione: (2026)
di: Yang, Jiayan, et al.
Pubblicazione: (2026)
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
di: Mu, Yao, et al.
Pubblicazione: (2024)
di: Mu, Yao, et al.
Pubblicazione: (2024)
Toward Graph-Tokenizing Large Language Models with Reconstructive Graph Instruction Tuning
di: Zhang, Zhongjian, et al.
Pubblicazione: (2026)
di: Zhang, Zhongjian, et al.
Pubblicazione: (2026)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
di: Xu, Peng, et al.
Pubblicazione: (2024)
di: Xu, Peng, et al.
Pubblicazione: (2024)
ANAH: Analytical Annotation of Hallucinations in Large Language Models
di: Ji, Ziwei, et al.
Pubblicazione: (2024)
di: Ji, Ziwei, et al.
Pubblicazione: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
di: Zhu, Yutao, et al.
Pubblicazione: (2024)
di: Zhu, Yutao, et al.
Pubblicazione: (2024)
LinguaLIFT: An Effective Two-stage Instruction Tuning Framework for Low-Resource Language Reasoning
di: Zhang, Hongbin, et al.
Pubblicazione: (2024)
di: Zhang, Hongbin, et al.
Pubblicazione: (2024)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
di: Luo, Junwei, et al.
Pubblicazione: (2024)
di: Luo, Junwei, et al.
Pubblicazione: (2024)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
di: Hu, Mengkang, et al.
Pubblicazione: (2025)
di: Hu, Mengkang, et al.
Pubblicazione: (2025)
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024)
di: Lan, Tian, et al.
Pubblicazione: (2024)
ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
di: Cao, Yihan, et al.
Pubblicazione: (2023)
di: Cao, Yihan, et al.
Pubblicazione: (2023)
Documenti analoghi
-
PixelFlow: Pixel-Space Generative Models with Flow
di: Chen, Shoufa, et al.
Pubblicazione: (2025) -
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
di: Sun, Peize, et al.
Pubblicazione: (2024) -
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
di: Ji, Yatai, et al.
Pubblicazione: (2024) -
Multi-RoI Human Mesh Recovery with Camera Consistency and Contrastive Losses
di: Nie, Yongwei, et al.
Pubblicazione: (2024) -
DetVPCC: RoI-based Point Cloud Sequence Compression for 3D Object Detection
di: Yan, Mingxuan, et al.
Pubblicazione: (2025)