Sens.aiAI signal desk
TodayRadarBriefing
Admin sign in
Sens.aiSensif.aiAI signal desk
ModelsResearchCountriesOpen vs ClosedComputeBetaCommentary
Loading…
TodayRadarBriefingAdmin

Radar

Research Radar

Which research topics are accelerating, and where earlier papers have already landed in shipped models.

Filtered to Multimodal — 150 papersClear filter

More papers match this topic — see “Show more” below.

Papers this week

50

Trending topic

Agents

▲ 23%

papers this window vs prior window

Papers linked to models

149

linked by the desk, past 90 days

Median days paper → model

—

lower is faster

Topic velocity

papers this window by topic · Δ vs prior window · a paper can carry more than one topic

AgentsAgents
135▲23%
Evaluation & BenchmarksEvaluation & Benchmarks
38▲41%
MultimodalMultimodal
23▼30%
Safety & Alignment

Topic momentum

prior window → this window

Agents

135 this window ▲23%

Evaluation & Benchmarks

38 this window ▲41%

Multimodal

23 this window ▼30%

Where research lands: paper → model linkage

Links are AI-inferred by the desk's LLM from tech reports, system cards and citations — each carries a confidence level and is not a claim by the authors.

Recursive Synthesis for Long-Horizon Terminal Tasks

arXiv:2608.05466AI-inferred · high

Otter: A Time-Aware, History-Conditioned Human Chess AI

arXiv:2608.05206AI-inferred · high

ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation

arXiv:2608.05893AI-inferred · high

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

Filtered to Multimodal — 150 papersClear filter

More papers match this topic — see “Show more” below.

Papers on Multimodal

Clear filter
multimodal prompt learningelectronic health recordspublished Aug 25, 2026 · arXiv:2608.21941

Multimodal Prompt Learning with Irregular EHRs for Robust Monitoring of Critical Care Patients

vision-language modelsqualitative mechanical problem-solvingpublished Aug 25, 2026 · arXiv:2608.22143

Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems

Safety & Alignment
23▲53%
Training & OptimizationTraining & Optimization
21▲50%
Efficiency & InferenceEfficiency & Inference
20▼5%
ReasoningReasoning
14▲27%
InterpretabilityInterpretability
12▼20%
Reinforcement LearningReinforcement Learning
11▼21%
Retrieval & RAGRetrieval & RAG
9▼18%
Privacy & SecurityPrivacy & Security
8▲300%
Code GenerationCode Generation
8▼27%
Generative ModelsGenerative Models
7▼53%
Robotics & Embodied AIRobotics & Embodied AI
70%
Language UnderstandingLanguage Understanding
5▲25%
Speech & AudioSpeech & Audio
5▼17%
Mixture of ExpertsMixture of Experts
3▲50%
Long ContextLong Context
3▼40%
Computer VisionComputer Vision
2▼75%
Data & Synthetic DataData & Synthetic Data
1▼75%
OtherOther
163▲11%
View as table
TopicPapers this windowPrior windowΔ
Agents135110+23%
Evaluation & Benchmarks3827+41%
Multimodal2333-30%
Safety & Alignment2315+53%
Training & Optimization2114+50%
Efficiency & Inference2021-5%
Reasoning1411+27%
Interpretability1215-20%
Reinforcement Learning1114-21%
Retrieval & RAG911-18%
Privacy & Security82+300%
Code Generation811-27%
Generative Models715-53%
Robotics & Embodied AI770%
Language Understanding54+25%
Speech & Audio56-17%
Mixture of Experts32+50%
Long Context35-40%
Computer Vision28-75%
Data & Synthetic Data14-75%
Other163147+11%

Safety & Alignment

23 this window ▲53%

Training & Optimization

21 this window ▲50%

Efficiency & Inference

20 this window ▼5%
arXiv:2608.06110
AI-inferred · high

SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

arXiv:2608.05212AI-inferred · high

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

arXiv:2608.05587AI-inferred · high

Runtime Observability for Heterogeneous Attention Memory

arXiv:2608.05863AI-inferred · high

Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

arXiv:2608.05411AI-inferred · high

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

arXiv:2608.05381AI-inferred · high

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

arXiv:2608.05628AI-inferred · high

Counterfactual Analysis via Large Language Models

arXiv:2608.05367AI-inferred · high

EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

arXiv:2608.05519AI-inferred · high
Qwen 3.8 Max1 link
Otter1 link
GPT-5.68 links
DeepSeek V4-Flash1 link
Gemini 3.7 Flash2 links
claude-fable-5, claude-sonnet-5, claude-opus-51 link
View as table
PaperLinked modelRelationConfidence
Recursive Synthesis for Long-Horizon Terminal Tasks (2608.05466)Qwen 3.8 Maxtechnique used98%
Otter: A Time-Aware, History-Conditioned Human Chess AI (2608.05206)Otterrelated100%
ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation (2608.05893)GPT-5.6technique used98%
ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment (2608.06110)GPT-5.6evaluates85%
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents (2608.05212)GPT-5.6evaluates98%
StepReflect: Structured UI Transition Reflection for Mobile GUI Agents (2608.05587)GPT-5.6evaluates95%
Runtime Observability for Heterogeneous Attention Memory (2608.05863)DeepSeek V4-Flashrelated90%
Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index (2608.05411)Gemini 3.7 Flashevaluates99%
Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index (2608.05411)GPT-5.6evaluates99%
C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models (2608.05381)Gemini 3.7 Flashevaluates98%
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation (2608.05628)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation (2608.05628)GPT-5.6evaluates98%
Counterfactual Analysis via Large Language Models (2608.05367)GPT-5.6evaluates98%
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents (2608.05519)GPT-5.6evaluates95%
Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints (2608.06949)GPT-5.6evaluates98%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)Grokevaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)Gemini 3.7 Flashevaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)GPT-5.6evaluates96%
MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning (2608.22167)GPT-5.6technique used95%
Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems (2608.22143)Qwen 3.8 Maxevaluates98%
Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems (2608.22143)Gemma 4evaluates98%
GenCoord: Skill-Path Commitments under Private Information (2608.22055)Qwen 3.8 Maxtechnique used98%
More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning (2608.22048)Qwen 3.8 Maxevaluates100%
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (2608.22191)Qwen 3.8 Maxevaluates98%
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (2608.22191)GPT-5.6evaluates98%
Redteaming Leading Arabic LLMs with ASAS (2608.21985)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Redteaming Leading Arabic LLMs with ASAS (2608.21985)GPT-5.6evaluates98%
Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning (2608.22128)Gemini 3.7 Flashevaluates95%
MEMORY Wins All: Indirect Bias Injection Attacks via Social Media Feeds (2608.22061)GPT-5.6evaluates95%
HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews (2608.21868)Qwen 3.8 Maxtechnique used99%
Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning (2608.21811)Qwen 3.8 Maxevaluates98%
HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries (2608.21792)Qwen 3.8 Maxtechnique used99%
ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling (2608.21712)Athena-Brain-8Btechnique used99%
Context as an Environment: Programmatic Context Management for Long-Horizon Agents (2608.21690)Qwen 3.8 Maxevaluates95%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)GPT-5.6evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)Gemini 3.7 Flashevaluates98%
Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning (2608.21501)Qwen 3.8 Maxevaluates99%
KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference (2608.21362)Qwen 3.8 Maxevaluates98%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)GPT-5.6evaluates100%
IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents (2608.06735)DeepSeek-V4-Flash-0731evaluates95%
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs (2608.07167)GPT-5.6evaluates98%
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader (2608.06474)GPT-5.6evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)GPT-5.6evaluates99%
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory (2608.07169)GPT-5.6 Lunatechnique used98%
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills (2608.07885)GPT-5.6 Lunaevaluates98%
SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents (2608.08055)DeepSeek-V4-Flash-0731technique used98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)DeepSeek-V4-Flash-0731evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GLM-5.3evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GPT-5.6 Lunaevaluates98%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)GPT-5.6 Lunaevaluates99%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)Gemini 3.7 Flashevaluates99%
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines (2608.07813)DeepSeek-V4-Flash-0731evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Grok 4.6evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)GPT-5.6 Lunaevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Gemini 3.7 Flashevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Can Legal AI Know When It Is Wrong? And Do Students Know When It Is? (2608.21089)GPT-5.6 Lunaevaluates99%
Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol (2608.20729)Qwen 3.8 Maxevaluates98%
Why2Speak: Faithful Reasoning for Abstaining Action Policies (2608.20670)Qwen 3.8 Maxevaluates98%
No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators (2608.20938)Qwen 3.8 Maxevaluates99%
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation (2608.20797)Qwen 3.8 Maxtechnique used98%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)GPT-5.6 Lunaevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Qwen 3.8 Maxevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Gemma 4evaluates99%
Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design (2608.20755)GPT-5.6 Lunatechnique used95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Gemma 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Mistral OCR 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Qwen 3.8 Maxevaluates95%
Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory (2608.20397)Qwen 3.8 Maxevaluates99%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Gemma 4evaluates98%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Qwen 3.8 Maxevaluates98%
PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure (2608.20342)claude-fable-5, claude-sonnet-5, claude-opus-5technique used98%
Personalized Privacy Control in LLMs via Attention Head Intervention (2608.21209)Qwen 3.8 Maxevaluates99%
TreeWY: Speculative Verification for Gated DeltaNet Hybrids (2608.20961)Qwen 3.8 Maxevaluates98%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Gemma 4evaluates99%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Qwen 3.8 Maxevaluates99%
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth (2608.20574)Grok 4.6evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)GPT-5.6 Lunaevaluates99%
SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation (2608.10775)GPT-5.6 Lunaevaluates98%
CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation (2608.10090)DeepSeek-V4-Flash-0731evaluates98%
DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments? (2608.10366)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (2608.11341)GPT-5.6 Lunaevaluates98%
AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research (2608.11216)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
MBA: Multimodal Benchmark and Agents for Real-World Business Ideation (2608.11616)GPT-5.6 Lunatechnique used98%
When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs (2608.11403)Qwen 3.8 27Bevaluates99%
XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication (2608.11676)Qwen 3.8 27Bevaluates95%
Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges (2608.12097)GPT-5.6 Lunaevaluates95%
HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting (2608.11692)Qwen 3.8 27Bevaluates99%
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning (2608.11994)GPT-5.6 Lunaevaluates95%
From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate (2608.11381)Qwen 3.8 27Btechnique used98%
Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets (2608.11233)Qwen 3.8 27Btechnique used99%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)GPT-5.6 Lunaevaluates95%
FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents (2608.11683)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (2608.12036)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates86%
Harnessing agent memory to build lifelong AI partners for materials scientists (2608.11224)GPT-5.6 Lunaevaluates95%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)GPT-5.6 Lunaevaluates99%
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS (2608.12249)claude-fable-5, claude-sonnet-5, claude-opus-5technique used95%
Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration (2608.11210)Qwen 3.8 27Bevaluates95%
From Monolithic to Modular: Segment-level Automatic Prompt Optimization (2608.11219)GPT-5.6 Lunaevaluates98%
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle (2608.11241)claude-fable-5, claude-sonnet-5, claude-opus-5technique used90%
Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces (2608.12585)GPT-5.6 Lunaevaluates95%
Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes (2608.13420)Qwen 3.8 27Bevaluates98%
Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing (2608.13156)Qwen 3.8 27Bevaluates95%
Jointly Predicting Courses and Grades Using a Transformer-Based Model (2608.13409)trace-supervised symbolic neural CPUtechnique used99%
Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI) (2608.13063)Qwen 3.8 27Bevaluates99%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)AlphaEvolverelated94%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)GPT-5.6 Lunaevaluates98%
Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents (2608.12476)Qwen 3.8 27Bevaluates99%
Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs (2608.12675)Qwen 3.8 27Bevaluates95%
Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence (2608.12928)GPT-5.6 Lunaevaluates99%
From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL (2608.13787)GPT-5.6 Lunaevaluates95%
Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation (2608.13754)GPT-5.6 Lunaevaluates99%
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages (2608.14375)GPT-5.6 Lunaevaluates95%
MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends (2608.13883)GPT-5.6 Lunaevaluates95%
Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence (2608.13958)GPT-5.6 Lunaevaluates100%
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (2608.14290)Qwen 3.8 Maxrelated95%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)DeepSeek-V4-Flash-0731evaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)GPT-5.6 Lunaevaluates95%
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning (2608.14552)GPT-5.6 Lunaevaluates99%
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry (2608.14680)DeepSeek-V4-Flash-0731evaluates98%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)GPT-5.6 Lunatechnique used98%
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models (2608.15145)GPT-5.6 Lunaevaluates95%
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning (2608.14558)GPT-5.6 Lunaevaluates98%
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines (2608.14588)GPT-5.6 Lunaevaluates98%
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks (2608.14927)GPT-5.6 Lunaevaluates95%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)Qwen 3.8 Maxevaluates98%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)GPT-5.6 Lunaevaluates98%
When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models (2608.19230)GPT-5.6 Lunaevaluates98%
MidTool: Mid-training Data Synthesis for Agentic Tool Use (2608.20314)Qwen 3.8 Maxtechnique used98%
Automatic bioinformatic software named entity recognition from literature (2608.19201)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Grokevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Gemini 3.7 Flashevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)GPT-5.6 Lunaevaluates90%
Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping (2608.19220)GPT-5.6 Lunatechnique used99%
A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment (2608.19199)Athena-Brain-8Bevaluates98%
Phantom Gains: Auditing Self-Improvement Against a Measured Null (2608.20290)Qwen 3.8 Maxevaluates98%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)Gemini 3.7 Flashevaluates95%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)DeepSeek-V4-Flash-0731evaluates95%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)Gemini 3.7 Flashevaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)GPT-5.6 Lunaevaluates99%
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning (2608.19842)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)DeepSeek-V4-Flash-0731evaluates98%
From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG (2608.19535)Qwen 3.8 Maxevaluates99%
Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation (2608.19299)GPT-5.6 Lunaevaluates80%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Grokevaluates98%
Different Facets of Verbalised Overconfidence: an Interpretability Study (2608.18106)Qwen 3.8 Maxevaluates99%
DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models (2608.18103)DeepSeek V4-Flashtechnique used99%
Abliteration Mitigation via Refusal Aliases (2608.18093)Gemma 4evaluates99%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Gemma 4evaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Qwen 3.8 Maxevaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Mistral OCR 4evaluates85%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Qwen 3.8 Maxevaluates99%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Mistral OCR 4evaluates99%
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication (2608.19161)Qwen 3.8 Maxevaluates98%
Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference (2608.18591)Qwen 3.8 Maxtechnique used100%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)Qwen 3.8 Maxevaluates98%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair (2608.18324)Qwen 3.8 Maxevaluates98%
Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu (2608.18142)Mistral OCR 4evaluates99%
Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions (2608.18078)DeepSeek V4-Flashevaluates95%
Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS) (2608.18100)GPT-5.6 Lunaevaluates99%
Breaking the weakest link to evade vision language models (2608.18938)Qwen 3.8 Maxevaluates99%
Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models (2608.18884)Qwen 3.8 Maxevaluates98%
CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence (2608.18613)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (2608.18423)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)Qwen 3.8 Maxevaluates98%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)GPT-5.6 Lunaevaluates80%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Qwen 3.8 Maxevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Gemini 3.7 Flashevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)GPT-5.6 Lunaevaluates99%
Potential of ChatGPT in predicting stock market trends based on Twitter Sentiment Analysis (2311.06273)GPT-5.6 Lunaevaluates95%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)GPT-5.6 Lunaevaluates98%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)Gemini 3.7 Flashevaluates98%
Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch (2608.17684)Qwen 3.8 Maxevaluates98%
The Price of Thinking: Reasoning Effort as a Model-Specific API Contract (2608.16956)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing (2608.17638)GPT-5.6 Lunaevaluates95%
TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation (2608.17588)GPT-5.6 Lunaevaluates95%
Agent Lightning v1.0: Towards Harnessed Agentic RL (2608.17528)Qwen 3.8 Maxevaluates99%
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (2608.17393)Qwen 3.8 Maxevaluates99%
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration (2608.17336)Qwen 3.8 Maxevaluates98%
SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning (2608.17301)Qwen 3.8 Maxevaluates98%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Grok 4.6evaluates99%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Gemini 3.7 Flashevaluates98%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)GPT-5.6 Lunaevaluates98%
FedPref: Federated Preference Learning for Structured Radiology Report Extraction (2608.16971)Qwen 3.8 Maxtechnique used99%
Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification (2608.17247)GPT-5.6 Lunaevaluates98%
GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents (2608.16890)GPT-5.6 Lunaevaluates99%
GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents (2608.16890)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)DeepSeek V4-Flashevaluates99%
LinkedQwen 3.8 MaxGemma 4
multimodal information extractionvision-language modelspublished Aug 25, 2026 · arXiv:2608.22214

Query-Driven Multimodal Information Extraction from Long Documents

multimodal large language modelssituational illusionspublished Aug 25, 2026 · arXiv:2608.22232

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

multi-agent systemslarge language modelspublished Aug 25, 2026 · arXiv:2608.21868

HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews

LinkedQwen 3.8 Max
reinforcement learningvision-language modelspublished Aug 25, 2026 · arXiv:2608.21811

Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning

LinkedQwen 3.8 Max
multimodal language modelsvision-language modelspublished Aug 25, 2026 · arXiv:2608.21430

Evaluating Multimodal Narrative Understanding of Popular Hollywood Films

speculative decodingdiffusion-based parallel draftingpublished Aug 24, 2026 · arXiv:2608.20743

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

vision-language modelstheory of mindpublished Aug 24, 2026 · arXiv:2608.20975

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

EEGaffective-state classificationpublished Aug 24, 2026 · arXiv:2608.20807

Neuro-Geospatial Modelling of EEG Affective States Using Literature-Informed Environmental Context

multimodal large language modelsvolumetric radiologypublished Aug 24, 2026 · arXiv:2608.20549

Volumetric Radiology AI in the Era of Multimodal Large Language Models

multimodal agentsskill retrievalpublished Aug 24, 2026 · arXiv:2608.20389

Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness

multimodal machine learningaffect recognitionpublished Aug 24, 2026 · arXiv:2608.20384

Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles

large language modelslarge multimodal modelspublished Aug 24, 2026 · arXiv:2608.20379

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

multimodal large language modelsAI safetypublished Aug 24, 2026 · arXiv:2608.21100

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

vision-language modelsmultimodal question answeringpublished Aug 24, 2026 · arXiv:2608.20414

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5GPT-5.6 Luna
split-conformal predictionclass-conditional coveragepublished Aug 21, 2026 · arXiv:2608.19376

Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?

time-series retrievalretrieval-augmented generationpublished Aug 21, 2026 · arXiv:2608.19218

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

multimodal large language modelsvisual spatial planningpublished Aug 21, 2026 · arXiv:2608.20237

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

multimodal machine learningsentiment analysispublished Aug 21, 2026 · arXiv:2608.20019

Contrastive Mixed Prompt Learning for Incomplete Multimodal Sentiment Analysis with Unseen Modality Combination

multimodal reasoningmulti-agent coordinationpublished Aug 20, 2026 · arXiv:2608.18878

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

multimodal document understandinginference-time reasoning budgetspublished Aug 20, 2026 · arXiv:2608.18591

Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference

LinkedQwen 3.8 Max
multimodal retrievalmultimodal language modelspublished Aug 20, 2026 · arXiv:2608.18504

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

structured information extractionoptical character recognitionpublished Aug 20, 2026 · arXiv:2608.18289

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

backdoor attacksNLP securitypublished Aug 20, 2026 · arXiv:2608.18095

Backdoor Learning in Language Models and Vision-Language Models

multimodal RAGknowledge-graph retrievalpublished Aug 18, 2026 · arXiv:2608.15056

GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG

multimodal large language modelstext and audio modalitiespublished Aug 18, 2026 · arXiv:2608.14651

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

visual question answeringdocument retrievalpublished Aug 18, 2026 · arXiv:2608.14841

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

multimodal machine learningaudio-visual reasoningpublished Aug 18, 2026 · arXiv:2608.14558

The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning

LinkedGPT-5.6 Luna
opinion extractionscience and technology intelligencepublished Aug 17, 2026 · arXiv:2608.14152

Towards Efficient Multimodal and Multilingual Opinion Extraction for STI: A QLoRA-Based Fine-Tuning Approach

reinforcement learningmultimodal learningpublished Aug 17, 2026 · arXiv:2608.14157

Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine

spatial transcriptomicsmorphology and gene-expression integrationpublished Aug 17, 2026 · arXiv:2608.14355

Disentangled Shared Representations Improve Morpho-Transcriptomic Integration

scientific figure and table comprehensioninformation extractionpublished Aug 17, 2026 · arXiv:2608.14075

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

computer visionvision-language modelspublished Aug 15, 2026 · arXiv:2608.12677

The Role of Natural Language Understanding in Multimodal Video-Based Dengue Diagnosis

remote sensingvision-language modelspublished Aug 15, 2026 · arXiv:2608.13344

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

embodied agentsrobotic planningpublished Aug 15, 2026 · arXiv:2608.12743

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

vision-language-action modelsautonomous drivingpublished Aug 15, 2026 · arXiv:2608.12932

FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving

multimodal document understandinglarge language modelspublished Aug 13, 2026 · arXiv:2608.12133

GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings

multimodal embeddingstext-to-image retrievalpublished Aug 13, 2026 · arXiv:2608.11343

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5GPT-5.6 Luna
multimodal benchmarksbusiness ideation agentspublished Aug 13, 2026 · arXiv:2608.11616

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

LinkedGPT-5.6 Luna
multimodal knowledge graphsknowledge-augmented generationpublished Aug 13, 2026 · arXiv:2608.11244

BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model

embodied AIvision-language modelspublished Aug 13, 2026 · arXiv:2608.11692

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

LinkedQwen 3.8 27B
vision-language-action modelsautonomous drivingpublished Aug 12, 2026 · arXiv:2608.10976

XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

multimodal large language modelsreasoning verificationpublished Aug 12, 2026 · arXiv:2608.10665

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

multimodal learningemotion recognitionpublished Aug 12, 2026 · arXiv:2608.10448

Rationale-Guided Learning for Multimodal Emotion Recognition

vision-language modelslatent-space communicationpublished Aug 12, 2026 · arXiv:2608.10198

Post-Hoc Sparse Coding of Latent Communication Between Vision-Language Model Agents

multimodal learningmutual information disentanglementpublished Aug 12, 2026 · arXiv:2608.09986

MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis

large multimodal agentsintelligent transportation systemspublished Aug 11, 2026 · arXiv:2608.08184

Large Multimodal Agents for Intelligent Transportation Systems: Architectures, Evidence, and Deployment Challenges

vision-language modelsmultimodal reasoningpublished Aug 11, 2026 · arXiv:2608.07955

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

autonomous drivingmulti-agent systemspublished Aug 11, 2026 · arXiv:2608.07621

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

vision-language navigationvision-language-action policiespublished Aug 10, 2026 · arXiv:2608.07267

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

multimodal sensingstudent engagement predictionpublished Aug 10, 2026 · arXiv:2608.07188

SetEasy: A Multi-Modal Classroom Engagement Assessment and Seating Optimization Framework

long-document understandingdynamic evidence retrievalpublished Aug 10, 2026 · arXiv:2608.07067

DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding

large multimodal modelsmodality transferpublished Aug 10, 2026 · arXiv:2608.06948

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

multimodal large language modelsscientific discoverypublished Aug 10, 2026 · arXiv:2608.06931

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

large multimodal modelscomputer visionpublished Aug 10, 2026 · arXiv:2608.06917

ReGraph: Learning to Generate Recipe Graphs from Food Images

agentic multimodal large language modelsmodel mergingpublished Aug 10, 2026 · arXiv:2608.06699

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

multimodal large language modelsvisual token pruningpublished Aug 10, 2026 · arXiv:2608.06411

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

multimodal large language modelscreative capability evaluationpublished Aug 10, 2026 · arXiv:2608.06501

Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

multimodal agentsexecutive decision makingpublished Aug 7, 2026 · arXiv:2608.05864

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

multimodal large language modelsomnimodal modelspublished Aug 7, 2026 · arXiv:2608.05381

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

LinkedGemini 3.7 Flash
knowledge graph completionmultimodal knowledge graphspublished Aug 7, 2026 · arXiv:2608.05833

ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion

vision-language modelsvideogamespublished Aug 7, 2026 · arXiv:2608.05949

VLMs for Videogame Data Annotation

multimodal emotion recognition in conversationsmixture of expertspublished Aug 6, 2026 · arXiv:2608.04013

C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

vision-language modelscounterfactual consistencypublished Aug 6, 2026 · arXiv:2608.04509

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

Monte Carlo Tree Searchlarge language modelspublished Aug 6, 2026 · arXiv:2608.04071

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

paddy rice mappingsemantic segmentationpublished Aug 6, 2026 · arXiv:2608.04154

TRNet: Topography-Guided Frequency Rectification and Structure-Aware Decoding for Multimodal Paddy Rice Segmentation

multimodal representation learningvariational autoencoderspublished Aug 6, 2026 · arXiv:2608.04016

AI-driven Multimodal Representation Learning for Latent Mediation Structure Discovery of Socioeconomic Disadvantage, Psychosocial Factors, and Cardiometabolic Multimorbidity: Insights from the All of Us Research Program

multimodal large language modelsvisualized task semanticspublished Aug 6, 2026 · arXiv:2608.04726

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

multimodal learningintent recognitionpublished Aug 6, 2026 · arXiv:2608.04054

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

chart annotation generationchart understandingpublished Aug 5, 2026 · arXiv:2608.03464

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

multimodal retrievallecture video understandingpublished Aug 5, 2026 · arXiv:2608.03161

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

multimodal named entity recognitionlatent diffusionpublished Aug 5, 2026 · arXiv:2608.03025

DiffImaginE: Imagine to Verify Entity Types with Diffusion

multimodal sentiment analysismodality reliabilitypublished Aug 5, 2026 · arXiv:2608.03611

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

computer-use agentsGUI automationpublished Aug 5, 2026 · arXiv:2608.03327

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

multimodal datasetssocial intention inferencepublished Aug 3, 2026 · arXiv:2607.28649

COSI-Lab: Conference Living Lab for Modeling Multi-Perspective Multimodal Social Intention

multimodal large language modelsmobile app generationpublished Aug 3, 2026 · arXiv:2607.28645

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

analytic memoryretrieval memorypublished Aug 3, 2026 · arXiv:2607.29440

Beyond Retrieval: Analytic Memory for Multimodal Agents

multimodal AIshopping agentspublished Aug 3, 2026 · arXiv:2607.29002

MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents

digital twinsmultimodal sensingpublished Aug 3, 2026 · arXiv:2607.28652

HenTwin: A Multimodal Digital Twin Framework for Longitudinal Biological State Monitoring in Laying Hens

multimodal agentslong-form video understandingpublished Aug 3, 2026 · arXiv:2607.28678

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

multimodal large language modelssocial intelligencepublished Jul 31, 2026 · arXiv:2607.26465

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

clinical data sciencecoding agentspublished Jul 31, 2026 · arXiv:2607.26155

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

vision-language modelsobject localizationpublished Jul 31, 2026 · arXiv:2607.26107

TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions

multimodal agentssocial deduction gamespublished Jul 31, 2026 · arXiv:2607.26393

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

face anti-spoofingmultimodal large language modelspublished Jul 31, 2026 · arXiv:2607.26432

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

knowledge-intensive multimodal question answeringsparse cross-modal routingpublished Jul 30, 2026 · arXiv:2607.25422

Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

multimodal large language modelsaccessible visualizationpublished Jul 30, 2026 · arXiv:2607.25021

Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization

edge AImultimodal agentspublished Jul 30, 2026 · arXiv:2607.24770

ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop

drug discoveryzero-shot property predictionpublished Jul 30, 2026 · arXiv:2607.25322

From Cellular Responses to Pharmacological Domains: Multimodal Zero-Shot Drug Representation Learning

knowledge injectiononline distillationpublished Jul 30, 2026 · arXiv:2607.24771

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection

vision-language modelsremote sensingpublished Jul 30, 2026 · arXiv:2607.24810

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

KV cachingKV-cache compressionpublished Jul 28, 2026 · arXiv:2607.22586

MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models

multimodal retrieval-augmented generationagentic planningpublished Jul 28, 2026 · arXiv:2607.22643

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

user preference modelingmultimodal large language modelspublished Jul 28, 2026 · arXiv:2607.22603

Group Preference Collapse in Personalized Multimodal Large Language Models

vision-language modelschart understandingpublished Jul 28, 2026 · arXiv:2607.22600

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

vlog editingmultimodal large language modelspublished Jul 28, 2026 · arXiv:2607.22632

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

visual token compressionvideo token managementpublished Jul 24, 2026 · arXiv:2607.20981

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

electrocardiogram interpretationmultimodal large language modelspublished Jul 24, 2026 · arXiv:2607.20814

Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

multimodal large language modelscontinual learningpublished Jul 24, 2026 · arXiv:2607.20511

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

LLM watermarkingmedical AIpublished Jul 24, 2026 · arXiv:2607.20462

Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

omni-modal modelson-policy distillationpublished Jul 24, 2026 · arXiv:2607.20918

OPOD: On-Policy Omni Distillation

multimodal large language modelsagentic AIpublished Jul 23, 2026 · arXiv:2607.19767

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

multimodal agentsagentic searchpublished Jul 23, 2026 · arXiv:2607.19793

Silent Failures in Multimodal Agentic Search: A Diagnostic Taxonomy and Cross-Judge Evaluation

reinforcement learningoffline supervisionpublished Jul 23, 2026 · arXiv:2607.19399

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

virtual realityclinical assessmentpublished Jul 22, 2026 · arXiv:2607.19063

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

vision-language modelsmulti-view spatial reasoningpublished Jul 21, 2026 · arXiv:2607.17243

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

synthetic aperture radarremote sensingpublished Jul 21, 2026 · arXiv:2607.16819

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

multimodal large language modelschain-of-thought reasoningpublished Jul 21, 2026 · arXiv:2607.16727

Constraint-Anchored Reasoning Traces

multimodal question answeringGraphRAGpublished Jul 21, 2026 · arXiv:2607.16208

ColGraphRAG: Late-Interaction Evidence Retrieval for Multimodal GraphRAG

multimodal intelligencemultimodal representationpublished Jul 21, 2026 · arXiv:2607.16560

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

multimodal searche-commercepublished Jul 21, 2026 · arXiv:2607.17499

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

world modelsdata-first ontologypublished Jul 21, 2026 · arXiv:2607.17269

An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation

vision-language modelsprompt engineeringpublished Jul 20, 2026 · arXiv:2607.15565

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

human motion captureembodied AIpublished Jul 20, 2026 · arXiv:2607.15868

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

event-based visionmulti-modal sensor fusionpublished Jul 20, 2026 · arXiv:2607.15794

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

electronic health recordsclinical predictionpublished Jul 20, 2026 · arXiv:2607.15380

Large Language Models as Unified Multimodal Learners for Clinical Prediction

autonomous drivingvision-language-action modelspublished Jul 20, 2026 · arXiv:2607.15621

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

AI for Sciencemultimodal learningpublished Jul 20, 2026 · arXiv:2607.15686

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

multimodal machine learningvision-language modelspublished Jul 20, 2026 · arXiv:2607.15442

Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes

biometric verificationfingerprint recognitionpublished Jul 20, 2026 · arXiv:2607.15517

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

diffusion modelsmultimodal machine learningpublished Jul 20, 2026 · arXiv:2607.15592

MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

visual question answeringmultimodal large language modelspublished Jul 20, 2026 · arXiv:2607.15418

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

vision-language modelsmultimodal large language modelspublished Jul 17, 2026 · arXiv:2607.14499

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

medical imagingbrain oncologypublished Jul 17, 2026 · arXiv:2607.14581

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

action supervisionmultimodal representation learningpublished Jul 17, 2026 · arXiv:2607.14635

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

multimodal large language modelstopological agent frameworkspublished Jul 17, 2026 · arXiv:2607.14658

TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning

vision-language modelsstreet view imagerypublished Jul 17, 2026 · arXiv:2607.14756

AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

multimodal document question answeringvisual groundingpublished Jul 17, 2026 · arXiv:2607.14682

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

industrial intelligenceprognostics and health managementpublished Jul 17, 2026 · arXiv:2607.14510

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

multimodal large language modelscontent safetypublished Jul 17, 2026 · arXiv:2607.14256

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

scientific visualizationvisualization literacypublished Jul 17, 2026 · arXiv:2607.15176

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

multimodal datasetsemotion recognitionpublished Jul 17, 2026 · arXiv:2607.14683

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

vision-language modelsphysical strategic reasoningpublished Jul 17, 2026 · arXiv:2607.14616

SportD: Can VLMs Physically Strategize?

diffusion multimodal large language modelsMLP activation sparsitypublished Jul 17, 2026 · arXiv:2607.14557

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

multimodal machine learninguncertainty-aware fusionpublished Jul 14, 2026 · arXiv:2607.10599

MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis

multimodal reasoningvision-language modelspublished Jul 14, 2026 · arXiv:2607.10966

SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

web agentsmultimodal action groundingpublished Jul 14, 2026 · arXiv:2607.10079

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

multimodal large language modelsreinforcement learningpublished Jul 13, 2026 · arXiv:2607.09492

Multimodal Reward Hacking in Reinforcement Learning

video anomaly detectionevent cameraspublished Jul 13, 2026 · arXiv:2607.09114

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

multimodal survival predictionclinical oncologypublished Jul 13, 2026 · arXiv:2607.09521

SAGEAgent: A Self-Evolving Agent for Cost-Aware Modality Acquisition in Multimodal Survival Prediction

large vision-language modelsdocument understandingpublished Jul 13, 2026 · arXiv:2607.09068

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

vision-language modelsmulti-view integrationpublished Jul 13, 2026 · arXiv:2607.08970

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

multimodal clinical reasoningonline medical consultationpublished Jul 13, 2026 · arXiv:2607.09142

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

vision-language modelsdiffusion modelspublished Jul 10, 2026 · arXiv:2607.07907

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

multimodal machine learningexplainable artificial intelligencepublished Jul 10, 2026 · arXiv:2607.08573

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

sleep physiologypolysomnographypublished Jul 10, 2026 · arXiv:2607.07720

Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS--ANS Dynamic

document parsingmultimodal modelspublished Jul 10, 2026 · arXiv:2607.07836

Infinity-Parser2 Technical Report

vision-language modelsvisual question answeringpublished Jul 10, 2026 · arXiv:2607.08745

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

vision-language modelsfood understandingpublished Jul 10, 2026 · arXiv:2607.08423

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

Show more