Salvato in:
| Autori principali: | Hou, Xinhai, Xu, Shaoyuan, Biyani, Manan, Li, Moyan, Liu, Jia, Hollon, Todd C., Wang, Bryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2511.19661 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CodeV: Issue Resolving with Visual Data
di: Zhang, Linhao, et al.
Pubblicazione: (2024)
di: Zhang, Linhao, et al.
Pubblicazione: (2024)
CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
di: Yu, Yifan, et al.
Pubblicazione: (2025)
di: Yu, Yifan, et al.
Pubblicazione: (2025)
Towards Scalable Language-Image Pre-training for 3D Medical Imaging
di: Zhao, Chenhui, et al.
Pubblicazione: (2025)
di: Zhao, Chenhui, et al.
Pubblicazione: (2025)
Extending SEEDS to a Supervoxel Algorithm for Medical Image Analysis
di: Zhao, Chenhui, et al.
Pubblicazione: (2025)
di: Zhao, Chenhui, et al.
Pubblicazione: (2025)
A self-supervised framework for learning whole slide representations
di: Hou, Xinhai, et al.
Pubblicazione: (2024)
di: Hou, Xinhai, et al.
Pubblicazione: (2024)
Step-Calibrated Diffusion for Biomedical Optical Image Restoration
di: Lyu, Yiwei, et al.
Pubblicazione: (2024)
di: Lyu, Yiwei, et al.
Pubblicazione: (2024)
QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation
di: Zhu, Yaoyu, et al.
Pubblicazione: (2025)
di: Zhu, Yaoyu, et al.
Pubblicazione: (2025)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
di: Le, Binh M., et al.
Pubblicazione: (2025)
di: Le, Binh M., et al.
Pubblicazione: (2025)
Super-resolution of biomedical volumes with 2D supervision
di: Jiang, Cheng, et al.
Pubblicazione: (2024)
di: Jiang, Cheng, et al.
Pubblicazione: (2024)
CodeV: Empowering LLMs with HDL Generation through Multi-Level Summarization
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
di: Song, Qi, et al.
Pubblicazione: (2025)
di: Song, Qi, et al.
Pubblicazione: (2025)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units
di: Wang, Ruibin, et al.
Pubblicazione: (2026)
di: Wang, Ruibin, et al.
Pubblicazione: (2026)
UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization
di: Yang, Zhen, et al.
Pubblicazione: (2025)
di: Yang, Zhen, et al.
Pubblicazione: (2025)
Learning Attribute-Aware Hash Codes for Fine-Grained Image Retrieval via Query Optimization
di: Wang, Peng, et al.
Pubblicazione: (2025)
di: Wang, Peng, et al.
Pubblicazione: (2025)
Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment
di: Xie, Wulin, et al.
Pubblicazione: (2026)
di: Xie, Wulin, et al.
Pubblicazione: (2026)
HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks
di: Zhang, Fengji, et al.
Pubblicazione: (2024)
di: Zhang, Fengji, et al.
Pubblicazione: (2024)
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
di: Li, Yantao, et al.
Pubblicazione: (2026)
di: Li, Yantao, et al.
Pubblicazione: (2026)
CodedVO: Coded Visual Odometry
di: Shah, Sachin, et al.
Pubblicazione: (2024)
di: Shah, Sachin, et al.
Pubblicazione: (2024)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
di: Lee, Naeun, et al.
Pubblicazione: (2026)
di: Lee, Naeun, et al.
Pubblicazione: (2026)
QiMeng-CodeV-SVA: Training Specialized LLMs for Hardware Assertion Generation via RTL-Grounded Bidirectional Data Synthesis
di: Wu, Yutong, et al.
Pubblicazione: (2026)
di: Wu, Yutong, et al.
Pubblicazione: (2026)
Learning complete and explainable visual representations from itemized text supervision
di: Lyu, Yiwei, et al.
Pubblicazione: (2025)
di: Lyu, Yiwei, et al.
Pubblicazione: (2025)
Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs
di: Zhang, Houston H., et al.
Pubblicazione: (2025)
di: Zhang, Houston H., et al.
Pubblicazione: (2025)
Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections
di: Dhiman, Ankit, et al.
Pubblicazione: (2024)
di: Dhiman, Ankit, et al.
Pubblicazione: (2024)
CodeEnhance: A Codebook-Driven Approach for Low-Light Image Enhancement
di: Wu, Xu, et al.
Pubblicazione: (2024)
di: Wu, Xu, et al.
Pubblicazione: (2024)
Image Coding for Machines via Feature-Preserving Rate-Distortion Optimization
di: Fernández-Menduiña, Samuel, et al.
Pubblicazione: (2025)
di: Fernández-Menduiña, Samuel, et al.
Pubblicazione: (2025)
Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
di: Jia, Xu
Pubblicazione: (2025)
di: Jia, Xu
Pubblicazione: (2025)
RECODE: Reasoning Through Code Generation for Visual Question Answering
di: Shen, Junhong, et al.
Pubblicazione: (2025)
di: Shen, Junhong, et al.
Pubblicazione: (2025)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
Improving Image Coding for Machines through Optimizing Encoder via Auxiliary Loss
di: Iino, Kei, et al.
Pubblicazione: (2024)
di: Iino, Kei, et al.
Pubblicazione: (2024)
Geometry-Aware Sparse Depth Sampling for High-Fidelity RGB-D Depth Completion in Robotic Systems
di: Salloom, Tony, et al.
Pubblicazione: (2025)
di: Salloom, Tony, et al.
Pubblicazione: (2025)
ProDAT: Progressive Density-Aware Tail-Drop for Point Cloud Coding
di: Luo, Zhe, et al.
Pubblicazione: (2025)
di: Luo, Zhe, et al.
Pubblicazione: (2025)
CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity
di: Yin, Guang, et al.
Pubblicazione: (2025)
di: Yin, Guang, et al.
Pubblicazione: (2025)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
di: Yang, Wenhao, et al.
Pubblicazione: (2026)
di: Yang, Wenhao, et al.
Pubblicazione: (2026)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
di: Liu, Jie, et al.
Pubblicazione: (2026)
di: Liu, Jie, et al.
Pubblicazione: (2026)
Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis
di: Yang, Yixuan, et al.
Pubblicazione: (2026)
di: Yang, Yixuan, et al.
Pubblicazione: (2026)
Stereo Image Coding for Machines with Joint Visual Feature Compression
di: Jin, Dengchao, et al.
Pubblicazione: (2025)
di: Jin, Dengchao, et al.
Pubblicazione: (2025)
ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
di: Wang, Youqi, et al.
Pubblicazione: (2026)
di: Wang, Youqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CodeV: Issue Resolving with Visual Data
di: Zhang, Linhao, et al.
Pubblicazione: (2024) -
CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
di: Yu, Yifan, et al.
Pubblicazione: (2025) -
Towards Scalable Language-Image Pre-training for 3D Medical Imaging
di: Zhao, Chenhui, et al.
Pubblicazione: (2025) -
Extending SEEDS to a Supervoxel Algorithm for Medical Image Analysis
di: Zhao, Chenhui, et al.
Pubblicazione: (2025) -
A self-supervised framework for learning whole slide representations
di: Hou, Xinhai, et al.
Pubblicazione: (2024)