PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yuqun, Zhao, Yuxuan, Chen, Sijia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
par: Yang, Yehui, et autres
Publié: (2026)
par: Yang, Yehui, et autres
Publié: (2026)
Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
par: Li, Chenjun
Publié: (2026)
par: Li, Chenjun
Publié: (2026)
Defect Detection Network In PCB Circuit Devices Based on GAN Enhanced YOLOv11
par: Huang, Jiayi, et autres
Publié: (2025)
par: Huang, Jiayi, et autres
Publié: (2025)
SARDet-100K: Towards Open-Source Benchmark and ToolKit for Large-Scale SAR Object Detection
par: Li, Yuxuan, et autres
Publié: (2024)
par: Li, Yuxuan, et autres
Publié: (2024)
Improving Quality Control of Whole Slide Images by Explicit Artifact Augmentation
par: Jurgas, Artur, et autres
Publié: (2024)
par: Jurgas, Artur, et autres
Publié: (2024)
LoLI-Street: Benchmarking Low-Light Image Enhancement and Beyond
par: Islam, Md Tanvir, et autres
Publié: (2024)
par: Islam, Md Tanvir, et autres
Publié: (2024)
Adversarial Watermarking for Face Recognition
par: Yao, Yuguang, et autres
Publié: (2024)
par: Yao, Yuguang, et autres
Publié: (2024)
Towards Lossless Ultimate Vision Token Compression for VLMs
par: Zheng, Dehua, et autres
Publié: (2025)
par: Zheng, Dehua, et autres
Publié: (2025)
Asking like Socrates: Socrates helps VLMs understand remote sensing images
par: Shao, Run, et autres
Publié: (2025)
par: Shao, Run, et autres
Publié: (2025)
Probabilistic Wildfire Spread Prediction Using an Autoregressive Conditional Generative Adversarial Network
par: Kang, Taehoon, et autres
Publié: (2025)
par: Kang, Taehoon, et autres
Publié: (2025)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
Listener-Rewarded Thinking in VLMs for Image Preferences
par: Gambashidze, Alexander, et autres
Publié: (2025)
par: Gambashidze, Alexander, et autres
Publié: (2025)
ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
par: Kaur, Rachneet, et autres
Publié: (2025)
par: Kaur, Rachneet, et autres
Publié: (2025)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
Bayes-DIC Net: Estimating Digital Image Correlation Uncertainty with Bayesian Neural Networks
par: Chen, Biao, et autres
Publié: (2025)
par: Chen, Biao, et autres
Publié: (2025)
iPEAR: Iterative Pyramid Estimation with Attention and Residuals for Deformable Medical Image Registration
par: Wu, Heming, et autres
Publié: (2025)
par: Wu, Heming, et autres
Publié: (2025)
Towards Domain Adaptive Neural Contextual Bandits
par: Wang, Ziyan, et autres
Publié: (2024)
par: Wang, Ziyan, et autres
Publié: (2024)
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025)
par: Pani, Anupam, et autres
Publié: (2025)
Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs
par: Chen, Yanlong, et autres
Publié: (2026)
par: Chen, Yanlong, et autres
Publié: (2026)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
par: Shen, Zhixuan, et autres
Publié: (2024)
par: Shen, Zhixuan, et autres
Publié: (2024)
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026)
par: Zhao, Shitian, et autres
Publié: (2026)
PEACE: Empowering Geologic Map Holistic Understanding with MLLMs
par: Huang, Yangyu, et autres
Publié: (2025)
par: Huang, Yangyu, et autres
Publié: (2025)
WiFi CSI Based Temporal Activity Detection via Dual Pyramid Network
par: Liu, Zhendong, et autres
Publié: (2024)
par: Liu, Zhendong, et autres
Publié: (2024)
D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition
par: Huang, Yiyang, et autres
Publié: (2025)
par: Huang, Yiyang, et autres
Publié: (2025)
Neural Implicit 3D Cardiac Shape Reconstruction from Sparse CT Angiography Slices Mimicking 2D Transthoracic Echocardiography Views
par: Jansen, Gino E., et autres
Publié: (2026)
par: Jansen, Gino E., et autres
Publié: (2026)
Employing Graph Representations for Cell-level Characterization of Melanoma MELC Samples
par: Monroy, Luis Carlos Rivera, et autres
Publié: (2022)
par: Monroy, Luis Carlos Rivera, et autres
Publié: (2022)
TinyDef-DETR: A Transformer-Based Framework for Defect Detection in Transmission Lines from UAV Imagery
par: Shen, Feng, et autres
Publié: (2025)
par: Shen, Feng, et autres
Publié: (2025)
STEAM-EEG: Spatiotemporal EEG Analysis with Markov Transfer Fields and Attentive CNNs
par: Qin, Jiahao, et autres
Publié: (2024)
par: Qin, Jiahao, et autres
Publié: (2024)
From Pixels to Predictions: Spectrogram and Vision Transformer for Better Time Series Forecasting
par: Zeng, Zhen, et autres
Publié: (2024)
par: Zeng, Zhen, et autres
Publié: (2024)
S&P 500 Stock's Movement Prediction using CNN
par: Gupta, Rahul
Publié: (2025)
par: Gupta, Rahul
Publié: (2025)
When VLMs Meet Image Classification: Test Sets Renovation via Missing Label Identification
par: Pang, Zirui, et autres
Publié: (2025)
par: Pang, Zirui, et autres
Publié: (2025)
Pyramid Self-contrastive Learning Framework for Test-time Ultrasound Image Denoising
par: Zhang, Jiajing, et autres
Publié: (2026)
par: Zhang, Jiajing, et autres
Publié: (2026)
FedDAG: Federated Domain Adversarial Generation Towards Generalizable Medical Image Analysis
par: Che, Haoxuan, et autres
Publié: (2025)
par: Che, Haoxuan, et autres
Publié: (2025)
Global Feature Pyramid Network
par: Xiao, Weilin, et autres
Publié: (2023)
par: Xiao, Weilin, et autres
Publié: (2023)
An Enhanced Pyramid Feature Network Based on Long-Range Dependencies for Multi-Organ Medical Image Segmentation
par: Tan, Dayu, et autres
Publié: (2025)
par: Tan, Dayu, et autres
Publié: (2025)
PyramidStyler: Transformer-Based Neural Style Transfer with Pyramidal Positional Encoding and Reinforcement Learning
par: Durairaju, Raahul Krishna, et autres
Publié: (2025)
par: Durairaju, Raahul Krishna, et autres
Publié: (2025)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
Learning Object Properties Using Robot Proprioception via Differentiable Robot-Object Interaction
par: Chen, Peter Yichen, et autres
Publié: (2024)
par: Chen, Peter Yichen, et autres
Publié: (2024)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
SPFFNet: Strip Perception and Feature Fusion Spatial Pyramid Pooling for Fabric Defect Detection
par: Zhao, Peizhe, et autres
Publié: (2025)
par: Zhao, Peizhe, et autres
Publié: (2025)
Documents similaires
-
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
par: Yang, Yehui, et autres
Publié: (2026) -
Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
par: Li, Chenjun
Publié: (2026) -
Defect Detection Network In PCB Circuit Devices Based on GAN Enhanced YOLOv11
par: Huang, Jiayi, et autres
Publié: (2025) -
SARDet-100K: Towards Open-Source Benchmark and ToolKit for Large-Scale SAR Object Detection
par: Li, Yuxuan, et autres
Publié: (2024) -
Improving Quality Control of Whole Slide Images by Explicit Artifact Augmentation
par: Jurgas, Artur, et autres
Publié: (2024)