Sens.aiAI signal desk
TodayRadarBriefing
Admin sign in
Sens.aiSensif.aiAI signal desk
ModelsResearchCountriesOpen vs ClosedComputeBetaCommentary
Loading…
TodayRadarBriefingAdmin

Radar

Research Radar

Which research topics are accelerating, and where earlier papers have already landed in shipped models.

Filtered to Agents — 350 papersClear filter

More papers match this topic — see “Show more” below.

Papers this week

50

Trending topic

Agents

▲ 26%

papers this window vs prior window

Papers linked to models

152

linked by the desk, past 90 days

Median days paper → model

—

lower is faster

Topic velocity

papers this window by topic · Δ vs prior window · a paper can carry more than one topic

AgentsAgents
138▲26%
Evaluation & BenchmarksEvaluation & Benchmarks
37▲37%
MultimodalMultimodal
24▼27%
Safety & Alignment

Topic momentum

prior window → this window

Agents

138 this window ▲26%

Evaluation & Benchmarks

37 this window ▲37%

Multimodal

24 this window ▼27%

Where research lands: paper → model linkage

Links are AI-inferred by the desk's LLM from tech reports, system cards and citations — each carries a confidence level and is not a claim by the authors.

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

arXiv:2608.04032AI-inferred · high

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

arXiv:2608.04205AI-inferred · high

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

arXiv:2608.04240AI-inferred · high

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

Filtered to Agents — 350 papersClear filter

More papers match this topic — see “Show more” below.

Papers on Agents

Clear filter
reinforcement learninglarge language modelspublished Aug 25, 2026 · arXiv:2608.22167

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning

LinkedGPT-5.6
embodied agentsmulti-agent coordinationpublished Aug 25, 2026 · arXiv:2608.22055
Safety & Alignment
24▲60%
Efficiency & InferenceEfficiency & Inference
210%
Training & OptimizationTraining & Optimization
21▲50%
ReasoningReasoning
13▲18%
InterpretabilityInterpretability
11▼27%
Reinforcement LearningReinforcement Learning
10▼29%
Retrieval & RAGRetrieval & RAG
8▼27%
Code GenerationCode Generation
8▼27%
Privacy & SecurityPrivacy & Security
7▲250%
Generative ModelsGenerative Models
7▼53%
Robotics & Embodied AIRobotics & Embodied AI
70%
Language UnderstandingLanguage Understanding
5▲25%
Speech & AudioSpeech & Audio
5▼17%
Mixture of ExpertsMixture of Experts
3▲50%
Long ContextLong Context
3▼40%
Computer VisionComputer Vision
2▼75%
Data & Synthetic DataData & Synthetic Data
1▼75%
OtherOther
163▲11%
View as table
TopicPapers this windowPrior windowΔ
Agents138110+26%
Evaluation & Benchmarks3727+37%
Multimodal2433-27%
Safety & Alignment2415+60%
Efficiency & Inference21210%
Training & Optimization2114+50%
Reasoning1311+18%
Interpretability1115-27%
Reinforcement Learning1014-29%
Retrieval & RAG811-27%
Code Generation811-27%
Privacy & Security72+250%
Generative Models715-53%
Robotics & Embodied AI770%
Language Understanding54+25%
Speech & Audio56-17%
Mixture of Experts32+50%
Long Context35-40%
Computer Vision28-75%
Data & Synthetic Data14-75%
Other163147+11%

Safety & Alignment

24 this window ▲60%

Efficiency & Inference

21 this window ▲0%

Training & Optimization

21 this window ▲50%
arXiv:2608.05141
AI-inferred · high

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

arXiv:2608.04719AI-inferred · high

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv:2608.05144AI-inferred · high

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

arXiv:2608.04030AI-inferred · high

Recursive Synthesis for Long-Horizon Terminal Tasks

arXiv:2608.05466AI-inferred · high

Otter: A Time-Aware, History-Conditioned Human Chess AI

arXiv:2608.05206AI-inferred · high

ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation

arXiv:2608.05893AI-inferred · high

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

arXiv:2608.06110AI-inferred · high

SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

arXiv:2608.05212AI-inferred · high
claude-fable-5, claude-sonnet-5, claude-opus-53 links
GPT-5.67 links
OctoLong-Instruct1 link
Gemini 3.7 Flash1 link
Qwen 3.8 Max1 link
Otter1 link
View as table
PaperLinked modelRelationConfidence
EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis (2608.04032)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates85%
MatrAIx: Simulating the World with 8.3 Billion Persona Agents (2608.04205)GPT-5.6technique used95%
MatrAIx: Simulating the World with 8.3 Billion Persona Agents (2608.04205)claude-fable-5, claude-sonnet-5, claude-opus-5technique used95%
Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary (2608.04240)GPT-5.6evaluates100%
OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling (2608.05141)OctoLong-Instructevaluates98%
Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools (2608.04719)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning (2608.05144)GPT-5.6evaluates98%
NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts (2608.04030)Gemini 3.7 Flashevaluates99%
NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts (2608.04030)GPT-5.6evaluates99%
Recursive Synthesis for Long-Horizon Terminal Tasks (2608.05466)Qwen 3.8 Maxtechnique used98%
Otter: A Time-Aware, History-Conditioned Human Chess AI (2608.05206)Otterrelated100%
ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation (2608.05893)GPT-5.6technique used98%
ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment (2608.06110)GPT-5.6evaluates85%
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents (2608.05212)GPT-5.6evaluates98%
StepReflect: Structured UI Transition Reflection for Mobile GUI Agents (2608.05587)GPT-5.6evaluates95%
Runtime Observability for Heterogeneous Attention Memory (2608.05863)DeepSeek V4-Flashrelated90%
Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index (2608.05411)Gemini 3.7 Flashevaluates99%
Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index (2608.05411)GPT-5.6evaluates99%
C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models (2608.05381)Gemini 3.7 Flashevaluates98%
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation (2608.05628)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation (2608.05628)GPT-5.6evaluates98%
Counterfactual Analysis via Large Language Models (2608.05367)GPT-5.6evaluates98%
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents (2608.05519)GPT-5.6evaluates95%
Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints (2608.06949)GPT-5.6evaluates98%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)Grokevaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)Gemini 3.7 Flashevaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)GPT-5.6evaluates96%
MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning (2608.22167)GPT-5.6technique used95%
Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems (2608.22143)Qwen 3.8 Maxevaluates98%
Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems (2608.22143)Gemma 4evaluates98%
GenCoord: Skill-Path Commitments under Private Information (2608.22055)Qwen 3.8 Maxtechnique used98%
More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning (2608.22048)Qwen 3.8 Maxevaluates100%
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (2608.22191)Qwen 3.8 Maxevaluates98%
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (2608.22191)GPT-5.6evaluates98%
Redteaming Leading Arabic LLMs with ASAS (2608.21985)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Redteaming Leading Arabic LLMs with ASAS (2608.21985)GPT-5.6evaluates98%
Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning (2608.22128)Gemini 3.7 Flashevaluates95%
MEMORY Wins All: Indirect Bias Injection Attacks via Social Media Feeds (2608.22061)GPT-5.6evaluates95%
HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews (2608.21868)Qwen 3.8 Maxtechnique used99%
Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning (2608.21811)Qwen 3.8 Maxevaluates98%
HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries (2608.21792)Qwen 3.8 Maxtechnique used99%
ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling (2608.21712)Athena-Brain-8Btechnique used99%
Context as an Environment: Programmatic Context Management for Long-Horizon Agents (2608.21690)Qwen 3.8 Maxevaluates95%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)GPT-5.6evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)Gemini 3.7 Flashevaluates98%
Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning (2608.21501)Qwen 3.8 Maxevaluates99%
KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference (2608.21362)Qwen 3.8 Maxevaluates98%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)GPT-5.6evaluates100%
IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents (2608.06735)DeepSeek-V4-Flash-0731evaluates95%
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs (2608.07167)GPT-5.6evaluates98%
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader (2608.06474)GPT-5.6evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)GPT-5.6evaluates99%
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory (2608.07169)GPT-5.6 Lunatechnique used98%
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills (2608.07885)GPT-5.6 Lunaevaluates98%
SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents (2608.08055)DeepSeek-V4-Flash-0731technique used98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)DeepSeek-V4-Flash-0731evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GLM-5.3evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GPT-5.6 Lunaevaluates98%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)GPT-5.6 Lunaevaluates99%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)Gemini 3.7 Flashevaluates99%
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines (2608.07813)DeepSeek-V4-Flash-0731evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Grok 4.6evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)GPT-5.6 Lunaevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Gemini 3.7 Flashevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Can Legal AI Know When It Is Wrong? And Do Students Know When It Is? (2608.21089)GPT-5.6 Lunaevaluates99%
Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol (2608.20729)Qwen 3.8 Maxevaluates98%
Why2Speak: Faithful Reasoning for Abstaining Action Policies (2608.20670)Qwen 3.8 Maxevaluates98%
No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators (2608.20938)Qwen 3.8 Maxevaluates99%
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation (2608.20797)Qwen 3.8 Maxtechnique used98%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)GPT-5.6 Lunaevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Qwen 3.8 Maxevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Gemma 4evaluates99%
Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design (2608.20755)GPT-5.6 Lunatechnique used95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Gemma 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Mistral OCR 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Qwen 3.8 Maxevaluates95%
Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory (2608.20397)Qwen 3.8 Maxevaluates99%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Gemma 4evaluates98%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Qwen 3.8 Maxevaluates98%
PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure (2608.20342)claude-fable-5, claude-sonnet-5, claude-opus-5technique used98%
Personalized Privacy Control in LLMs via Attention Head Intervention (2608.21209)Qwen 3.8 Maxevaluates99%
TreeWY: Speculative Verification for Gated DeltaNet Hybrids (2608.20961)Qwen 3.8 Maxevaluates98%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Gemma 4evaluates99%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Qwen 3.8 Maxevaluates99%
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth (2608.20574)Grok 4.6evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)GPT-5.6 Lunaevaluates99%
SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation (2608.10775)GPT-5.6 Lunaevaluates98%
CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation (2608.10090)DeepSeek-V4-Flash-0731evaluates98%
DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments? (2608.10366)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (2608.11341)GPT-5.6 Lunaevaluates98%
AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research (2608.11216)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
MBA: Multimodal Benchmark and Agents for Real-World Business Ideation (2608.11616)GPT-5.6 Lunatechnique used98%
When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs (2608.11403)Qwen 3.8 27Bevaluates99%
XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication (2608.11676)Qwen 3.8 27Bevaluates95%
Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges (2608.12097)GPT-5.6 Lunaevaluates95%
HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting (2608.11692)Qwen 3.8 27Bevaluates99%
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning (2608.11994)GPT-5.6 Lunaevaluates95%
From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate (2608.11381)Qwen 3.8 27Btechnique used98%
Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets (2608.11233)Qwen 3.8 27Btechnique used99%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)GPT-5.6 Lunaevaluates95%
FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents (2608.11683)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (2608.12036)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates86%
Harnessing agent memory to build lifelong AI partners for materials scientists (2608.11224)GPT-5.6 Lunaevaluates95%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)GPT-5.6 Lunaevaluates99%
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS (2608.12249)claude-fable-5, claude-sonnet-5, claude-opus-5technique used95%
Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration (2608.11210)Qwen 3.8 27Bevaluates95%
From Monolithic to Modular: Segment-level Automatic Prompt Optimization (2608.11219)GPT-5.6 Lunaevaluates98%
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle (2608.11241)claude-fable-5, claude-sonnet-5, claude-opus-5technique used90%
Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces (2608.12585)GPT-5.6 Lunaevaluates95%
Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes (2608.13420)Qwen 3.8 27Bevaluates98%
Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing (2608.13156)Qwen 3.8 27Bevaluates95%
Jointly Predicting Courses and Grades Using a Transformer-Based Model (2608.13409)trace-supervised symbolic neural CPUtechnique used99%
Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI) (2608.13063)Qwen 3.8 27Bevaluates99%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)AlphaEvolverelated94%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)GPT-5.6 Lunaevaluates98%
Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents (2608.12476)Qwen 3.8 27Bevaluates99%
Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs (2608.12675)Qwen 3.8 27Bevaluates95%
Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence (2608.12928)GPT-5.6 Lunaevaluates99%
From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL (2608.13787)GPT-5.6 Lunaevaluates95%
Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation (2608.13754)GPT-5.6 Lunaevaluates99%
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages (2608.14375)GPT-5.6 Lunaevaluates95%
MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends (2608.13883)GPT-5.6 Lunaevaluates95%
Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence (2608.13958)GPT-5.6 Lunaevaluates100%
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (2608.14290)Qwen 3.8 Maxrelated95%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)DeepSeek-V4-Flash-0731evaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)GPT-5.6 Lunaevaluates95%
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning (2608.14552)GPT-5.6 Lunaevaluates99%
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry (2608.14680)DeepSeek-V4-Flash-0731evaluates98%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)GPT-5.6 Lunatechnique used98%
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models (2608.15145)GPT-5.6 Lunaevaluates95%
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning (2608.14558)GPT-5.6 Lunaevaluates98%
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines (2608.14588)GPT-5.6 Lunaevaluates98%
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks (2608.14927)GPT-5.6 Lunaevaluates95%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)Qwen 3.8 Maxevaluates98%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)GPT-5.6 Lunaevaluates98%
When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models (2608.19230)GPT-5.6 Lunaevaluates98%
MidTool: Mid-training Data Synthesis for Agentic Tool Use (2608.20314)Qwen 3.8 Maxtechnique used98%
Automatic bioinformatic software named entity recognition from literature (2608.19201)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Grokevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Gemini 3.7 Flashevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)GPT-5.6 Lunaevaluates90%
Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping (2608.19220)GPT-5.6 Lunatechnique used99%
A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment (2608.19199)Athena-Brain-8Bevaluates98%
Phantom Gains: Auditing Self-Improvement Against a Measured Null (2608.20290)Qwen 3.8 Maxevaluates98%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)Gemini 3.7 Flashevaluates95%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)DeepSeek-V4-Flash-0731evaluates95%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)Gemini 3.7 Flashevaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)GPT-5.6 Lunaevaluates99%
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning (2608.19842)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)DeepSeek-V4-Flash-0731evaluates98%
From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG (2608.19535)Qwen 3.8 Maxevaluates99%
Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation (2608.19299)GPT-5.6 Lunaevaluates80%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Grokevaluates98%
Different Facets of Verbalised Overconfidence: an Interpretability Study (2608.18106)Qwen 3.8 Maxevaluates99%
DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models (2608.18103)DeepSeek V4-Flashtechnique used99%
Abliteration Mitigation via Refusal Aliases (2608.18093)Gemma 4evaluates99%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Gemma 4evaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Qwen 3.8 Maxevaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Mistral OCR 4evaluates85%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Qwen 3.8 Maxevaluates99%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Mistral OCR 4evaluates99%
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication (2608.19161)Qwen 3.8 Maxevaluates98%
Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference (2608.18591)Qwen 3.8 Maxtechnique used100%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)Qwen 3.8 Maxevaluates98%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair (2608.18324)Qwen 3.8 Maxevaluates98%
Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu (2608.18142)Mistral OCR 4evaluates99%
Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions (2608.18078)DeepSeek V4-Flashevaluates95%
Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS) (2608.18100)GPT-5.6 Lunaevaluates99%
Breaking the weakest link to evade vision language models (2608.18938)Qwen 3.8 Maxevaluates99%
Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models (2608.18884)Qwen 3.8 Maxevaluates98%
CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence (2608.18613)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (2608.18423)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)Qwen 3.8 Maxevaluates98%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)GPT-5.6 Lunaevaluates80%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Qwen 3.8 Maxevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Gemini 3.7 Flashevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)GPT-5.6 Lunaevaluates99%
Potential of ChatGPT in predicting stock market trends based on Twitter Sentiment Analysis (2311.06273)GPT-5.6 Lunaevaluates95%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)GPT-5.6 Lunaevaluates98%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)Gemini 3.7 Flashevaluates98%
Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch (2608.17684)Qwen 3.8 Maxevaluates98%
The Price of Thinking: Reasoning Effort as a Model-Specific API Contract (2608.16956)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing (2608.17638)GPT-5.6 Lunaevaluates95%
TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation (2608.17588)GPT-5.6 Lunaevaluates95%
Agent Lightning v1.0: Towards Harnessed Agentic RL (2608.17528)Qwen 3.8 Maxevaluates99%
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (2608.17393)Qwen 3.8 Maxevaluates99%
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration (2608.17336)Qwen 3.8 Maxevaluates98%

GenCoord: Skill-Path Commitments under Private Information

LinkedQwen 3.8 Max
LLM agentssoftware repository evolutionpublished Aug 25, 2026 · arXiv:2608.21964

Repo2Skill-Evo: Repository Skills Go Stale in Silence

agentic AIsoftware agentspublished Aug 25, 2026 · arXiv:2608.21942

TessIndex: Capability Verified Identity System for the Agent Economy

agentic AIengineering designpublished Aug 25, 2026 · arXiv:2608.21976

Closed-loop AI achieves certifiable engineering design

software engineering agentstest-time scalingpublished Aug 25, 2026 · arXiv:2608.22191

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

LinkedQwen 3.8 MaxGPT-5.6
multi-agent systemsautonomous systemspublished Aug 25, 2026 · arXiv:2608.22160

AUDITA: certified auditing and causal attribution of adverse outcomes in autonomous multi-agent systems

reward hackingAI agent safetypublished Aug 25, 2026 · arXiv:2608.22103

Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks

indirect prompt injectionpersistent memory poisoningpublished Aug 25, 2026 · arXiv:2608.22061

MEMORY Wins All: Indirect Bias Injection Attacks via Social Media Feeds

LinkedGPT-5.6
web agentssynthetic environmentspublished Aug 25, 2026 · arXiv:2608.21898

Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning

LLM agentspersistent memorypublished Aug 25, 2026 · arXiv:2608.21867

MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance

GUI agentsmultimodal large language modelspublished Aug 25, 2026 · arXiv:2608.21830

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

long-horizon agentsagent memorypublished Aug 25, 2026 · arXiv:2608.21755

ECHO: A Cognitively Inspired, Auditable Memory Plane for Long-Horizon Agents

neural architecture searchTransformer modelspublished Aug 25, 2026 · arXiv:2608.21712

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

LinkedAthena-Brain-8B
long-horizon agentscontext managementpublished Aug 25, 2026 · arXiv:2608.21690

Context as an Environment: Programmatic Context Management for Long-Horizon Agents

LinkedQwen 3.8 Max
agentic AImulti-drone systemspublished Aug 25, 2026 · arXiv:2608.21444

Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities

scientific artificial intelligenceagent evaluationpublished Aug 25, 2026 · arXiv:2608.21601

K-Bench: measuring model performance on real scientific agent requests

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5GPT-5.6
agentic AIlarge language modelspublished Aug 24, 2026 · arXiv:2608.20844

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

LLM agentscriterion revisionpublished Aug 24, 2026 · arXiv:2608.20729

Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol

LinkedQwen 3.8 Max
instrumental convergenceagentic AIpublished Aug 24, 2026 · arXiv:2608.20940

The Logic of Machine Self-Preservation

agent skillscontinuous evaluationpublished Aug 24, 2026 · arXiv:2608.20614

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

LLM agentsruntime interventionpublished Aug 24, 2026 · arXiv:2608.21027

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

software agentsagent memorypublished Aug 24, 2026 · arXiv:2608.20664

DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents

mobile agentsVLM-as-judgepublished Aug 24, 2026 · arXiv:2608.20797

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

LinkedQwen 3.8 Max
multi-agent systemsdocument authoringpublished Aug 24, 2026 · arXiv:2608.20786

Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring

agentic searchconformal predictionpublished Aug 24, 2026 · arXiv:2608.20771

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

large language model agentsintegrated photonicspublished Aug 24, 2026 · arXiv:2608.20688

VortexChat: An agentic framework for autonomous multi-objective integrated photonic design

multi-agent LLMsconformal calibrationpublished Aug 24, 2026 · arXiv:2608.20564

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

agentic LLMsModel Context Protocolpublished Aug 24, 2026 · arXiv:2608.20397

Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory

LinkedQwen 3.8 Max
AI coding agentssoftware development lifecyclepublished Aug 24, 2026 · arXiv:2608.20341

SDAD: Spec-Driven Agentic Development for the AI-Native SDLC

LLM agentshierarchical memorypublished Aug 24, 2026 · arXiv:2608.20631

Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

LinkedGemma 4Qwen 3.8 Max
federated learninglarge language modelspublished Aug 24, 2026 · arXiv:2608.20518

FL-MAESTRO: Multi-Agent LLM Orchestration for Resource-Constrained Federated Learning

terminal agentsAI agentspublished Aug 24, 2026 · arXiv:2608.20485

Terminal Agents: A Survey of AI Agents in Command-Line Environments

agentic memoryretrieval failurepublished Aug 24, 2026 · arXiv:2608.20400

When Retrieval Fails Before It Begins: Structurally Indirect Prerequisite Eviction as a Retention Failure in Agentic Memory

large language modelshallucinationpublished Aug 21, 2026 · arXiv:2608.19206

Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses

conversational data collectionstated-preference surveyspublished Aug 21, 2026 · arXiv:2608.20320

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

mid-trainingagentic tool usepublished Aug 21, 2026 · arXiv:2608.20314

MidTool: Mid-training Data Synthesis for Agentic Tool Use

LinkedQwen 3.8 Max
recursive self-improvementLLM agentspublished Aug 21, 2026 · arXiv:2608.20318

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

LLM agentsskill inductionpublished Aug 21, 2026 · arXiv:2608.20274

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

LLM agentsskill selectionpublished Aug 21, 2026 · arXiv:2608.19993

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees

LLM agentsfinancial compliancepublished Aug 21, 2026 · arXiv:2608.19974

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

LinkedGemini 3.7 FlashDeepSeek-V4-Flash-0731
agentic AIneuroimagingpublished Aug 21, 2026 · arXiv:2608.19902

Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis

LLM agentsreinforcement learningpublished Aug 21, 2026 · arXiv:2608.19880

EnvHarness: Awakening Static Worlds for Agent Learning

LLM agentsworkflow verificationpublished Aug 21, 2026 · arXiv:2608.19861

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

LinkedGemini 3.7 Flashclaude-fable-5, claude-sonnet-5, claude-opus-5GPT-5.6 Luna
agentic reinforcement learningpolicy optimizationpublished Aug 21, 2026 · arXiv:2608.19842

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

LinkedQwen 3.8 Max
multi-agent systemslong-term memorypublished Aug 21, 2026 · arXiv:2608.19701

Beyond Memory Majority: Latent-Source Reasoning for Multi-Agent Memory Arbitration

agent memorystate trackingpublished Aug 21, 2026 · arXiv:2608.19652

Can Agent Memory Systems Track Evolving State?

LinkedQwen 3.8 MaxDeepSeek-V4-Flash-0731
interactive AI agentsactive inferencepublished Aug 21, 2026 · arXiv:2608.19202

Active Inference as Context Acquisition for AI Agents

AI agentsscientific data servicespublished Aug 21, 2026 · arXiv:2608.19625

Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale

AI agentsscientific research automationpublished Aug 21, 2026 · arXiv:2608.19511

Trust via Auditable Records for Communities of AI Scientist Agents

AI agentstool-use safetypublished Aug 21, 2026 · arXiv:2608.19303

Outcome Monitors: Recovery Affordances for Silent Tool Failures

multi-agent systemslarge language modelspublished Aug 20, 2026 · arXiv:2608.18103

DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models

LinkedDeepSeek V4-Flash
latent multi-agent communicationcovert coordinationpublished Aug 20, 2026 · arXiv:2608.19161

Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

LinkedQwen 3.8 Max
medical question answeringmulti-agent systemspublished Aug 20, 2026 · arXiv:2608.19029

Adaptive Memory and Reflection Multi-Agent System for Medical Question Answering

agentic AILLM-as-a-judgepublished Aug 20, 2026 · arXiv:2608.19002

A Theory of Post-hoc Debate Judgement

multi-turn reinforcement learningagentic workflowspublished Aug 20, 2026 · arXiv:2608.18682

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

generative AIlarge language modelspublished Aug 20, 2026 · arXiv:2608.18677

Sanyu Studio: A Multi-Agent System for Art-Historical Narrative Construction

terminal agentsagentic task synthesispublished Aug 20, 2026 · arXiv:2608.18580

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

AI agentsmulti-agent systemspublished Aug 20, 2026 · arXiv:2608.18543

Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement

AI code agentssoftware engineering agentspublished Aug 20, 2026 · arXiv:2608.18389

A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations

LinkedQwen 3.8 Maxclaude-fable-5, claude-sonnet-5, claude-opus-5
looped language modelscompositional tool callingpublished Aug 20, 2026 · arXiv:2608.18171

Looped Language Models Improve Compositional Tool Calling

agentic codingmulti-agent systemspublished Aug 20, 2026 · arXiv:2608.18167

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review

AI reasoning agentschain-of-thoughtpublished Aug 20, 2026 · arXiv:2608.18078

Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions

LinkedDeepSeek V4-Flash
multi-agent systemsscientific discoverypublished Aug 20, 2026 · arXiv:2608.19047

Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery

agentic AIreinforcement learningpublished Aug 20, 2026 · arXiv:2608.18852

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents

last-mile deliverymulti-agent decision-makingpublished Aug 20, 2026 · arXiv:2608.18846

ORBITER: Conflict-Aware Decision-Making for Agentic Last-Mile Delivery

agent evaluationautomatic metricspublished Aug 20, 2026 · arXiv:2608.18744

Metrics That Write Themselves: Evolving an Evaluator from Its Own Blind Spots

multi-agent systemsconversational business intelligencepublished Aug 20, 2026 · arXiv:2608.18740

A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation

cyber threat intelligenceLLM agentspublished Aug 20, 2026 · arXiv:2608.18613

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
long-horizon agent evaluationmulti-agent competitionpublished Aug 20, 2026 · arXiv:2608.18423

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
computer-use agentsGUI groundingpublished Aug 20, 2026 · arXiv:2608.18307

ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents

LinkedQwen 3.8 MaxGemini 3.7 FlashGPT-5.6 Luna
agentic AIartificial intelligencepublished Aug 20, 2026 · arXiv:2608.18110

Emergence of Agentic AI: A Review on Evolution, Background, Working Principles, Applications, Adoption Factors, and Future Research Directions

large language model agentsself-evolving agentspublished Aug 20, 2026 · arXiv:2608.18104

Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective

banking agentsadaptive fraudpublished Aug 20, 2026 · arXiv:2608.18136

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

AI agentsinvestment managementpublished Aug 20, 2026 · arXiv:2608.18099

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

multi-agent systemslarge language modelspublished Aug 20, 2026 · arXiv:2608.18092

Position: Multi-Agent Systems Should Prioritize Concurrency Control

AI agentsbehavioral testingpublished Aug 20, 2026 · arXiv:2608.18081

Position: Behavioral Systems Require Behavioral Tests

AI agentsknowledge-work agentspublished Aug 19, 2026 · arXiv:2608.18050

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents

LinkedGPT-5.6 LunaGemini 3.7 Flash
AI agentslarge language modelspublished Aug 19, 2026 · arXiv:2608.17800

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

LLM agent memorypersistent memorypublished Aug 19, 2026 · arXiv:2608.17756

D²ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

long-horizon agentsagent oversightpublished Aug 19, 2026 · arXiv:2608.17718

Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents

self-evolving agentsfinancial agentspublished Aug 19, 2026 · arXiv:2608.17684

Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch

LinkedQwen 3.8 Max
LLM agentsgroup polarizationpublished Aug 19, 2026 · arXiv:2608.17665

GraphWake: Group Polarization via Memory-Mediated Polarization Cascade in LLM-Agent Communities

AI agent safetyagent skillspublished Aug 19, 2026 · arXiv:2608.17588

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

LinkedGPT-5.6 Luna
agentic reinforcement learningagent harnessespublished Aug 19, 2026 · arXiv:2608.17528

Agent Lightning v1.0: Towards Harnessed Agentic RL

LinkedQwen 3.8 Max
LLM agentsalgorithmic designpublished Aug 19, 2026 · arXiv:2608.17471

When AI Designs AI: Innovation or Imitation?

LLM agentsagent harnessespublished Aug 19, 2026 · arXiv:2608.17433

Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations

browser agentsweb automationpublished Aug 19, 2026 · arXiv:2608.17319

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

interactive reinforcement learningmulti-turn dialoguepublished Aug 19, 2026 · arXiv:2608.17499

Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context

reinforcement learninggroup-relative policy optimizationpublished Aug 19, 2026 · arXiv:2608.17289

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

large language modelsagent-based recommendationpublished Aug 19, 2026 · arXiv:2608.16919

CARA: Cognitive Adaptive Recommendation Agent

large language model agentsurban simulationpublished Aug 19, 2026 · arXiv:2608.16897

CityReal: Human-Aligned Urban Behavior and City Dynamics Simulation with Large-Scale LLM Agents

language-model agentsquantum computingpublished Aug 19, 2026 · arXiv:2608.16900

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

self-improving agentstextual memorypublished Aug 19, 2026 · arXiv:2608.18066

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

agentic recommender systemsautonomous LLM agentspublished Aug 19, 2026 · arXiv:2608.18058

Delegation Asymmetry in Agentic Recommender Systems: Measuring Two-Sided Receptivity in Online Dating

financial time-series analysischange-point detectionpublished Aug 19, 2026 · arXiv:2608.17933

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

AI agentsagent toolspublished Aug 19, 2026 · arXiv:2608.17007

SkillEffect: Checked Lowering for Memory-Bounded Agent Tools

agentic reasoningmulti-agent collaborationpublished Aug 19, 2026 · arXiv:2608.17282

DeAR: Decentralized Agentic Reasoning via Capability Grounding and Collaborative Thought Navigation

personalized agentsretrieved user memorypublished Aug 19, 2026 · arXiv:2608.17247

Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification

bounded agentsmemory allocationpublished Aug 19, 2026 · arXiv:2608.17053

Memory Is Communication: The Frontier Between Remembering and Signaling

agentic AI safetyruntime governancepublished Aug 19, 2026 · arXiv:2608.16891

Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution

clinical trial programmingLLM agentspublished Aug 19, 2026 · arXiv:2608.16890

GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents

AI agentslong-horizon task executionpublished Aug 18, 2026 · arXiv:2608.15089

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

LinkedDeepSeek-V4-Flash-0731GPT-5.6 Luna
rigorous proof generationproof verificationpublished Aug 18, 2026 · arXiv:2608.15052

Andy: A Mathematical Agent for Rigorous Proof and Autonomous Research

agentic reinforcement learningon-policy self-distillationpublished Aug 18, 2026 · arXiv:2608.14945

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

AI agentsevaluation methodologypublished Aug 18, 2026 · arXiv:2608.14940

When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation

multi-agent language modelsreasoning taskspublished Aug 18, 2026 · arXiv:2608.14927

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

LinkedGPT-5.6 Luna
long-horizon agentsmulti-agent systemspublished Aug 18, 2026 · arXiv:2608.14870

JarvisBench: Always-on Intelligence Between Humans and Agents

agentic AIdata cleaningpublished Aug 18, 2026 · arXiv:2608.14765

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

semantic uncertaintysemantic entropypublished Aug 18, 2026 · arXiv:2608.14707

Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems

AI agentsscientific discoverypublished Aug 18, 2026 · arXiv:2608.14667

Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems

multi-agent LLM systemsKV-cache reusepublished Aug 18, 2026 · arXiv:2608.14624

Learning Agent Execution for KV-Cache Management in Agentic Serving

LLM reliabilitymulti-agent systemspublished Aug 18, 2026 · arXiv:2608.14588

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

LinkedGPT-5.6 Luna
AI agentstool loadingpublished Aug 18, 2026 · arXiv:2608.14943

Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-load, On-Demand Tool-Loading, Progressive Disclosure, and Hybrid

LLM agentsagent safetypublished Aug 18, 2026 · arXiv:2608.14590

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

LLM inferenceVRAM consumptionpublished Aug 18, 2026 · arXiv:2608.15117

Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads

preference distillationdirect preference optimizationpublished Aug 18, 2026 · arXiv:2608.14828

MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment

information retrievalagentic LLMspublished Aug 18, 2026 · arXiv:2608.14587

An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Document Layouts: A Plant Science Use Case

online harness learningcontext-to-harness skill compilationpublished Aug 18, 2026 · arXiv:2608.15071

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

agentic systemsruntime reliabilitypublished Aug 18, 2026 · arXiv:2608.14680

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

LinkedDeepSeek-V4-Flash-0731
LLM agentsmulti-agent interactionpublished Aug 18, 2026 · arXiv:2608.14613

Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Agent Interaction over A2A/MCP

Text-to-SQLSQL correctionpublished Aug 18, 2026 · arXiv:2608.15145

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

LinkedGPT-5.6 Luna
multi-agent reinforcement learningcommunication gatingpublished Aug 18, 2026 · arXiv:2608.14559

When to Communicate: Belief Distributions and KL Divergence for Principled Gating in Multi-Agent RL

agent memorymulti-session task completionpublished Aug 17, 2026 · arXiv:2608.13883

MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends

LinkedGPT-5.6 Luna
reinforcement learningautonomous LLM agentspublished Aug 17, 2026 · arXiv:2608.14109

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

social reasoningreinforcement learningpublished Aug 17, 2026 · arXiv:2608.13787

From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL

LinkedGPT-5.6 Luna
automatic judgingagent evaluationpublished Aug 17, 2026 · arXiv:2608.13564

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

autoresearch agentsmachine learning researchpublished Aug 17, 2026 · arXiv:2608.14354

ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond

LLM agentsproactive explorationpublished Aug 17, 2026 · arXiv:2608.14339

Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents

multi-agent orchestrationenterprise analyticspublished Aug 17, 2026 · arXiv:2608.14246

Polaris : Multi Agentic System for Conversational Enterprise Analytics

AI agent securitydigitally signed authorizationpublished Aug 17, 2026 · arXiv:2608.14074

Mandato: Protocol-Level Enforcement of Digitally Signed Mandates on AI Agent Actions with Cryptographically Chained Audit Trails

LLM agentslong-horizon executionpublished Aug 17, 2026 · arXiv:2608.14380

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

large language modelstool-using agentspublished Aug 17, 2026 · arXiv:2608.14035

Agent-Orchestration in Autonomous Chip Design

reinforcement learningreward fairnesspublished Aug 17, 2026 · arXiv:2608.13622

ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction

agentic systemscontinual learningpublished Aug 17, 2026 · arXiv:2608.13608

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

AI agentslong-term memorypublished Aug 17, 2026 · arXiv:2608.13606

MobileMem: Learning from a Year of Mobile Experiences

agent evaluationbehavioral consistencypublished Aug 17, 2026 · arXiv:2608.13598

Measuring Cross-Task Behavioral Consistency in Language Model Agents

multi-agent reasoningmessage selectionpublished Aug 17, 2026 · arXiv:2608.14375

Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

LinkedGPT-5.6 Luna
time series analysisagentic AIpublished Aug 17, 2026 · arXiv:2608.14270

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

LLM agentsagent skillspublished Aug 17, 2026 · arXiv:2608.14036

Demystifying Agent Skills: Why They Work-Until They Don't

Apple Silicon deploymentMPSpublished Aug 17, 2026 · arXiv:2608.13987

Nanbeige4.2-3B on Apple Silicon: Fixing Deployment Bugs and Decreasing Looped Transformer Memory Overhead

LLM agentsReActpublished Aug 17, 2026 · arXiv:2608.13667

Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

LLM agentsagent governancepublished Aug 17, 2026 · arXiv:2608.13574

Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents

AI research agentscandidate solution selectionpublished Aug 17, 2026 · arXiv:2608.13940

AI Research Preference Models

LLM agentspersonal memorypublished Aug 17, 2026 · arXiv:2608.13921

When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

multi-agent systemslatent communicationpublished Aug 15, 2026 · arXiv:2608.13317

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

reinforcement learning with verifiable rewardsmulti-turn LLM agentspublished Aug 15, 2026 · arXiv:2608.13179

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

multi-agent systemshuman-AI interactionpublished Aug 15, 2026 · arXiv:2608.13046

BoardroomAI: Dependency-Aware Human-Steerable Multi-Agent Deliberation through Evolving Decision Graphs

autonomous agentslong-horizon experimentationpublished Aug 15, 2026 · arXiv:2608.13417

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

multi-agent reinforcement learningunmanned surface vehiclespublished Aug 15, 2026 · arXiv:2608.12995

OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways

retrieval-augmented agentsquery-conditioned reusepublished Aug 15, 2026 · arXiv:2608.12847

Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories

AI agentsagent skillspublished Aug 15, 2026 · arXiv:2608.12610

@skills: Attention is all you have

medical imagingthyroid ultrasoundpublished Aug 15, 2026 · arXiv:2608.12590

Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting

multi-agent systemslarge language modelspublished Aug 15, 2026 · arXiv:2608.12674

Lines and Ladders: A Context-Aware Multi-Agent Framework for Large-Scale Retail Price Taxonomy

LLM agentsagent skillspublished Aug 15, 2026 · arXiv:2608.13173

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

machine learning theoryAI agentspublished Aug 15, 2026 · arXiv:2608.13060

VALG: An Agentic System for ML Theory Research

agent harnessesretrievalpublished Aug 15, 2026 · arXiv:2608.13228

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

AI agentsagent skillspublished Aug 15, 2026 · arXiv:2608.13120

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

LLM agentsagent steeringpublished Aug 15, 2026 · arXiv:2608.12654

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

agent memorybitemporal state transitionspublished Aug 15, 2026 · arXiv:2608.12476

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

LinkedQwen 3.8 27B
AI agentslong-term memorypublished Aug 15, 2026 · arXiv:2608.12428

MindMemOS: A Portable and Self-Evolving Memory Operating Layer for AI Agents

agentic AIlarge language modelspublished Aug 15, 2026 · arXiv:2608.12395

Research Assistant: AstraZeneca's Agentic System for R&D

multi-agent systemscontract net protocolpublished Aug 15, 2026 · arXiv:2608.12371

Multi-Agent Scheduling with LLM-Assisted Contract Net Negotiation for Stream Processing in Mobile Edge Computing

LLM agentsself-improvementpublished Aug 15, 2026 · arXiv:2608.12851

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

agentic workflowsprovenancepublished Aug 15, 2026 · arXiv:2608.12761

Correct Is Not Governed: Provenance Integrity in Agentic Workflows

multi-agent systemsagent reliabilitypublished Aug 15, 2026 · arXiv:2608.12895

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

AI agentstelecom network operationspublished Aug 13, 2026 · arXiv:2608.12002

CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations

tool-using LLM agentserror recoverypublished Aug 13, 2026 · arXiv:2608.11977

Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection

multi-agent language modelsrole learningpublished Aug 13, 2026 · arXiv:2608.11949

ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models

LLM agentsagent skillspublished Aug 13, 2026 · arXiv:2608.11888

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

heterogeneous multi-agent LLM systemslatent-level communicationpublished Aug 13, 2026 · arXiv:2608.11676

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

LinkedQwen 3.8 27B
mobile GUI agentsnovel-app generalizationpublished Aug 13, 2026 · arXiv:2608.11588

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

mobile agentsLLM-as-judge evaluationpublished Aug 13, 2026 · arXiv:2608.11434

Benchmarking LLM Judges for Mobile Agent Evaluation

multi-agent systemsmedical diagnosispublished Aug 13, 2026 · arXiv:2608.11420

Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology

AI agentsbenchmark reliabilitypublished Aug 13, 2026 · arXiv:2608.11323

Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations

language agentseditable graph memorypublished Aug 13, 2026 · arXiv:2608.11248

EvoGraph-Mem: Failure-Aware Editable Graph Memory for Long-Term Language Agents

AI agentsinfrastructure managementpublished Aug 13, 2026 · arXiv:2608.11234

InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

LLM-agent societiesagent-based modellingpublished Aug 13, 2026 · arXiv:2608.11215

Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop

benchmarkingagentic evaluationpublished Aug 13, 2026 · arXiv:2608.11236

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

agentic workflowslegacy software modernizationpublished Aug 13, 2026 · arXiv:2608.12249

An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
shopping agentslarge language modelspublished Aug 13, 2026 · arXiv:2608.11604

Learning from Online User Feedback for Shopping Agents

specialist LLM agentsprompt decompositionpublished Aug 13, 2026 · arXiv:2608.11381

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

LinkedQwen 3.8 27B
language modelsquantitative financepublished Aug 13, 2026 · arXiv:2608.11250

AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search

LLM agentsrecommender systemspublished Aug 13, 2026 · arXiv:2608.11241

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
agent memorylifelong AI systemspublished Aug 13, 2026 · arXiv:2608.11224

Harnessing agent memory to build lifelong AI partners for materials scientists

LinkedGPT-5.6 Luna
multi-agent systemscontrol theorypublished Aug 13, 2026 · arXiv:2608.11207

Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes

AI agentsfinancepublished Aug 13, 2026 · arXiv:2608.11683

FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
self-evolving agentsskill compressionpublished Aug 12, 2026 · arXiv:2608.11079

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure

agentic AIembodied AIpublished Aug 12, 2026 · arXiv:2608.10915

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

retrieval-augmented generationGUI agentspublished Aug 12, 2026 · arXiv:2608.10775

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

LinkedGPT-5.6 Luna
large language modelssearch agentspublished Aug 12, 2026 · arXiv:2608.10676

Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory

small language modelsagent skillspublished Aug 12, 2026 · arXiv:2608.10538

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

earth observationgeospatial reasoningpublished Aug 12, 2026 · arXiv:2608.10494

GeoForge: Non-Parametric Self-Evolving Agents for Earth-Observation Reasoning

AI agentsnatural-language contractingpublished Aug 12, 2026 · arXiv:2608.10475

Evaluating Rational Contracting in Natural Language

autoresearch agentsagentic designpublished Aug 12, 2026 · arXiv:2608.10424

Recovering Wasted Compute in Autoresearch Agents

hierarchical compositionalitysymbolic reasoningpublished Aug 12, 2026 · arXiv:2608.10330

Hierarchical Compositionality for An Assistive AI Agent

retrieval-augmented generationevolutionary auto-promptingpublished Aug 12, 2026 · arXiv:2608.10224

Self-evolving Agentic Customer Support System at LinkedIn

multi-agent systemsLLM securitypublished Aug 12, 2026 · arXiv:2608.10218

Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems

self-supervised learningplanning agentspublished Aug 12, 2026 · arXiv:2608.10157

SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents

agentic AI governanceAI safetypublished Aug 12, 2026 · arXiv:2608.10153

The CASE Framework: A Multi-Disciplinary Control Architecture for Governing Enterprise Agentic AI

AI agentsmemory systemspublished Aug 12, 2026 · arXiv:2608.10108

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

AI agentsmulti-agent systemspublished Aug 12, 2026 · arXiv:2608.10030

Automating and Scaling Behavioral Scientific Research on AI Agents

LLM agentsagent safetypublished Aug 12, 2026 · arXiv:2608.10669

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

multi-agent systemsshared memorypublished Aug 12, 2026 · arXiv:2608.10509

MAP-Graph: Provenance-Aware Shared Memory for Multi-Agent Workflows

memory-augmented agentsruntime provenancepublished Aug 12, 2026 · arXiv:2608.10502

From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents

data-science agentsreal-computer interactionpublished Aug 12, 2026 · arXiv:2608.10366

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
compliance detectionconstraint dependency graphspublished Aug 11, 2026 · arXiv:2608.08146

Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

constraint programmingLLM agentspublished Aug 11, 2026 · arXiv:2608.08127

Improving Constraint Models with LLM Agents

LLM agentsretrieval-augmented generationpublished Aug 11, 2026 · arXiv:2608.08055

SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents

LinkedDeepSeek-V4-Flash-0731
agent frameworksautomatic skill constructionpublished Aug 11, 2026 · arXiv:2608.08037

SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution

autonomous AI agentsAI safety and containmentpublished Aug 11, 2026 · arXiv:2608.08022

Legal Responsibilities Using Autonomous Agents For Artificial Intelligence

cybersecurity educationgenerative AI agentspublished Aug 11, 2026 · arXiv:2608.07965

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

autonomous AI agentsdata discoverypublished Aug 11, 2026 · arXiv:2608.07949

Guixu: Valuation-Driven Data Discovery for Autonomous AI Agents with On-Chain Attestation

LLM agentselectronic design automationpublished Aug 11, 2026 · arXiv:2608.07925

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

AI agent reliabilityfailure detectionpublished Aug 11, 2026 · arXiv:2608.07899

TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?

language-model reasoningagentic taskspublished Aug 11, 2026 · arXiv:2608.07885

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

LinkedGPT-5.6 Luna
mobile agentsbenchmarkingpublished Aug 11, 2026 · arXiv:2608.07775

AndroidReality: How Far Are Mobile Agents from the Real World?

quantum computingquantum speeduppublished Aug 11, 2026 · arXiv:2608.07743

QuantumMind: Constraint-Grounded Agentic Reasoning for Speedup Analysis in Quantum Computing

glaucoma detectionfundus photographypublished Aug 11, 2026 · arXiv:2608.07651

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

LinkedGPT-5.6 LunaGemini 3.7 Flash
agentic AImulti-agent orchestrationpublished Aug 11, 2026 · arXiv:2608.07627

From Single Chatbots to Governed Agent Ecosystems: An Agentic AI Pattern Catalogue and Orchestration Framework for Mission-Critical Hospital Information Management Systems

long-term agent memorycontinual learningpublished Aug 11, 2026 · arXiv:2608.07622

Controlled Memory Interference in Continual LLM Agents

LLM agentsautonomous procurementpublished Aug 11, 2026 · arXiv:2608.07538

When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains

multi-agent systemsagentic AIpublished Aug 11, 2026 · arXiv:2608.07532

Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems

researcher agentsknowledge graphspublished Aug 11, 2026 · arXiv:2608.07700

Towards Researcher Agents for Knowledge-Graph Question Answering

AI agent securityprompt injectionpublished Aug 10, 2026 · arXiv:2608.07167

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

LinkedGPT-5.6
agent evaluationagent harnessespublished Aug 10, 2026 · arXiv:2608.07346

An End-to-End Agent Auditing Engine

reinforcement learningclinical decision-makingpublished Aug 10, 2026 · arXiv:2608.07418

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

agent memorylanguage-model agentspublished Aug 10, 2026 · arXiv:2608.07169

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

LinkedGPT-5.6 Luna
automated multi-agent system designprompt optimizationpublished Aug 10, 2026 · arXiv:2608.07196

EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision

multiagent reinforcement learninglarge language modelspublished Aug 10, 2026 · arXiv:2608.07148

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

reinforcement learningmulti-turn agentspublished Aug 10, 2026 · arXiv:2608.07118

How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

world modelsmemory-augmented learningpublished Aug 10, 2026 · arXiv:2608.07107

MemWM: Memory-Augmented Text-Based World Model

long-horizon agentsmemory compressionpublished Aug 10, 2026 · arXiv:2608.07068

MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents

agent skillsMonte Carlo tree searchpublished Aug 10, 2026 · arXiv:2608.07056

BONSAI: Evolvability-Guided Tree Search over Skills

molecular designscientific agentspublished Aug 10, 2026 · arXiv:2608.06961

CAi Copilot: Reducing Operational Workload in Molecular Design through Intent-Driven Agentic Workflows

multi-agent LLMsdemographic biaspublished Aug 10, 2026 · arXiv:2608.06949

Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints

LinkedGPT-5.6
multi-agent systemsLLM agentspublished Aug 10, 2026 · arXiv:2608.06922

Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

large language modelsMonte Carlo tree searchpublished Aug 10, 2026 · arXiv:2608.06871

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

reinforcement learningBellman credit assignmentpublished Aug 10, 2026 · arXiv:2608.06861

Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

agent memorylong-horizon agentspublished Aug 10, 2026 · arXiv:2608.06745

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

reinforcement learninglarge language modelspublished Aug 10, 2026 · arXiv:2608.06735

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

LinkedDeepSeek-V4-Flash-0731
AI agentsuniversity curriculum extractionpublished Aug 10, 2026 · arXiv:2608.06530

KNOWPLAN: Knowledge-Driven AI Agents for Smart Degree Pathway Planning

agentic systemsautomated code generationpublished Aug 10, 2026 · arXiv:2608.06410

ADIAS: Automated Design of Interactive Agentic Systems

LLM agentsagent safetypublished Aug 10, 2026 · arXiv:2608.06909

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

AI agentsagent skillspublished Aug 10, 2026 · arXiv:2608.06891

SkillEval: Decomposing Agent Skill Quality into Interpretable Signals

web agentsagent evaluationpublished Aug 10, 2026 · arXiv:2608.06704

WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance

multi-agent systemsAI system safetypublished Aug 7, 2026 · arXiv:2608.05263

OrchestraBench: Evaluating Multi-Agent Orchestration Failure Modes, Recovery, and Decomposition Quality

autonomous research agentsgraph-guided planningpublished Aug 7, 2026 · arXiv:2608.05225

Project2Task: Graph-Guided Project-Level Planning for Autonomous Research

privileged on-policy distillationstate-matched routingpublished Aug 7, 2026 · arXiv:2608.05219

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

LLM agentsAI safetypublished Aug 7, 2026 · arXiv:2608.05695

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

agentic AIself-driving microscopypublished Aug 7, 2026 · arXiv:2608.05266

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

multi-agent systemsenterprise application integrationpublished Aug 7, 2026 · arXiv:2608.05159

Agentic Nesting: A New Methodology for Existing Enterprise Application Integration and Services

agentic AIintegrated sensing and communicationpublished Aug 7, 2026 · arXiv:2608.05792

When Agentic AI Meets Integrated Sensing and Communication

large language model agentsblockchainpublished Aug 7, 2026 · arXiv:2608.05790

ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution

terminal agentsrecursive verified synthesispublished Aug 7, 2026 · arXiv:2608.05466

Recursive Synthesis for Long-Horizon Terminal Tasks

LinkedQwen 3.8 Max
3D generationopen-world generationpublished Aug 7, 2026 · arXiv:2608.05248

WorldClaw: Agentic 3D Open-World Generation at Scale

agentic AIhospital AI systemspublished Aug 7, 2026 · arXiv:2608.06112

From Siloed Algorithms to Compliance-First Agentic Platforms: A Multi-Layered Architecture for Hospital AI Systems

mobile GUI agentsworld modelspublished Aug 7, 2026 · arXiv:2608.05891

AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents

LLM agentsskill reusepublished Aug 7, 2026 · arXiv:2608.05204

SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse

language-model agentsautonomous optical experimentspublished Aug 7, 2026 · arXiv:2608.05990

OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents

agentic executionLLM-as-a-Judgepublished Aug 7, 2026 · arXiv:2608.05573

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

autonomous analysis agentserror localizationpublished Aug 7, 2026 · arXiv:2608.05490

Innovation-Residual Auditing of Autonomous Analysis Agents: Localization, Detection Limits, Error Control, and Identifiability

LLM agentsagent benchmarkspublished Aug 7, 2026 · arXiv:2608.05519

EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

LinkedGPT-5.6
AI agentscross-device interactionpublished Aug 7, 2026 · arXiv:2608.05729

Unified Agent: Managing Interactions across Devices

clinical machine learningAutoMLpublished Aug 7, 2026 · arXiv:2608.05375

DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data

computer-use agentsagent memorypublished Aug 7, 2026 · arXiv:2608.05784

Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay

long-horizon web agentsagent failure attributionpublished Aug 7, 2026 · arXiv:2608.05212

SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

LinkedGPT-5.6
self-evolving agentsskill accumulationpublished Aug 7, 2026 · arXiv:2608.05810

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

mobile GUI agentsstructured predictionpublished Aug 7, 2026 · arXiv:2608.05587

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

LinkedGPT-5.6
large language model agentsskill distillationpublished Aug 7, 2026 · arXiv:2608.05245

Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning

multi-agent systemsneuro-symbolic AIpublished Aug 7, 2026 · arXiv:2608.05391

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

LLM agentsagent skill evolutionpublished Aug 7, 2026 · arXiv:2608.05628

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5GPT-5.6
prompt-side agent playbookstool-using language agentspublished Aug 7, 2026 · arXiv:2608.05778

When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment

tool-calling agentsmulti-turn dialoguepublished Aug 7, 2026 · arXiv:2608.06057

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

agentic conversational systemshealthcare AIpublished Aug 7, 2026 · arXiv:2608.06110

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

LinkedGPT-5.6
reinforcement learningcredit assignmentpublished Aug 7, 2026 · arXiv:2608.05987

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

retrieval-augmented generationsearch agentspublished Aug 7, 2026 · arXiv:2608.06012

HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards

LLM agentstool selectionpublished Aug 6, 2026 · arXiv:2608.04719

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
behavioral skill reconstructionblack-box attackspublished Aug 6, 2026 · arXiv:2608.04192

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

language agentsagent memorypublished Aug 6, 2026 · arXiv:2608.04830

ContextWeave: A Real-World Workflow Benchmark

recommendation systemsA/B testingpublished Aug 6, 2026 · arXiv:2608.04625

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

agentic AIdatacenter architecturepublished Aug 6, 2026 · arXiv:2608.04458

Architectural Implications of Agentic AI Workflows

hierarchical graph memorypath-level localizationpublished Aug 6, 2026 · arXiv:2608.05095

Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite

reward shapingprosocial artificial agentspublished Aug 6, 2026 · arXiv:2608.04663

Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning

AI agent safetypersistent memorypublished Aug 6, 2026 · arXiv:2608.04289

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

evidence graphsresearch automationpublished Aug 6, 2026 · arXiv:2608.04738

EviGraph: Evidence-Guided Autonomous Research Agents

long-horizon reasoningpersistent agent systemspublished Aug 6, 2026 · arXiv:2608.05144

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

LinkedGPT-5.6
electronic design automationLLM agentspublished Aug 6, 2026 · arXiv:2608.04032

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5
LLM agentspersonalized memorypublished Aug 6, 2026 · arXiv:2608.04095

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

prompt injectionLLM agentspublished Aug 6, 2026 · arXiv:2608.04053

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

agentic AIShapley valuationpublished Aug 6, 2026 · arXiv:2608.04562

What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

AI agentsfinancial taskspublished Aug 6, 2026 · arXiv:2608.04077

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

credit assignmentreinforcement learningpublished Aug 6, 2026 · arXiv:2608.05102

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

AI agent verificationlong-horizon agentspublished Aug 6, 2026 · arXiv:2608.04066

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

agentic AIred teamingpublished Aug 6, 2026 · arXiv:2608.04018

Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming

Verilog RTL generationmulti-agent systemspublished Aug 5, 2026 · arXiv:2608.02878

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

agentic systemsAI governancepublished Aug 5, 2026 · arXiv:2608.03214

The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems

data agentsbenchmarkingpublished Aug 5, 2026 · arXiv:2608.03451

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

tool-using agentsobservation planningpublished Aug 5, 2026 · arXiv:2608.02876

BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

multi-agent systemsagent securitypublished Aug 5, 2026 · arXiv:2608.03499

WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

multi-agent systemsAI agent economicspublished Aug 5, 2026 · arXiv:2608.03076

AI Agent Economics: Can Autonomous Economic Behavior Emerge among AI Agents under Minimal External Conditions?

agentic systemslarge language modelspublished Aug 5, 2026 · arXiv:2608.03609

Formal Verification of Agentic Systems over Operational Data

semantic abstractionslide generationpublished Aug 5, 2026 · arXiv:2608.03298

SeaSlides: Semantic Abstraction Layer for Agentic Slide Generation

large language model agentstool usepublished Aug 5, 2026 · arXiv:2608.03468

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

LLM agentslong-term memorypublished Aug 5, 2026 · arXiv:2608.03463

LeanMem: Simple and Efficient Long-Term Memory for LLM Agents

urban digital serviceslarge language model agentspublished Aug 5, 2026 · arXiv:2608.03018

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

multi-agent systemsclinical decision supportpublished Aug 5, 2026 · arXiv:2608.03190

TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology

large language model agentslong-term and short-term memorypublished Aug 5, 2026 · arXiv:2608.03137

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

LLM agentsexperience memorypublished Aug 5, 2026 · arXiv:2608.03420

Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory

AI safetymulti-agent evaluationpublished Aug 5, 2026 · arXiv:2608.03166

Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

multi-agent systemsknowledge-based forecastingpublished Aug 5, 2026 · arXiv:2608.03339

Traceable Multi-Agent System for Knowledge-Based Forecasting

agentic CADparametric program generationpublished Aug 5, 2026 · arXiv:2608.03062

TraceCAD: Trace-Guided Repair for Agentic CAD Generation

AI agentsagent managementpublished Aug 5, 2026 · arXiv:2608.03524

Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS

AI agentstool usepublished Aug 5, 2026 · arXiv:2608.03403

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

LLM agentstool usepublished Aug 5, 2026 · arXiv:2608.02650

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

large language modelsreinforcement learningpublished Aug 5, 2026 · arXiv:2608.03502

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

agent safetybenchmark validitypublished Aug 3, 2026 · arXiv:2607.28685

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

LLM agentspartial observabilitypublished Aug 3, 2026 · arXiv:2607.28942

NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability

AI agentsagent governancepublished Aug 3, 2026 · arXiv:2607.28691

Code Is the Body: Agent-Owned Software Bodies for Recursive Evolution and Descent

agent evaluationAI assurancepublished Aug 3, 2026 · arXiv:2607.29405

Beyond Component Testing: Validating Agentic AI Systems

AI system securityruntime authorizationpublished Aug 3, 2026 · arXiv:2607.29190

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

LLM agentsMinecraftpublished Aug 3, 2026 · arXiv:2607.29218

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

agentic reinforcement learningscientific data analysispublished Aug 3, 2026 · arXiv:2607.28990

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

program repair agentsvalidation evidencepublished Aug 3, 2026 · arXiv:2607.28871

Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

tactical reasoninggame-based evaluationpublished Aug 3, 2026 · arXiv:2607.29577

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

GUI agentslarge language modelspublished Aug 3, 2026 · arXiv:2607.29320

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

AI agentstool-use safetypublished Aug 3, 2026 · arXiv:2607.29254

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

LLM agentsautonomous scientific experimentationpublished Aug 3, 2026 · arXiv:2607.29626

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

multi-agent planningspatio-temporal logicpublished Aug 3, 2026 · arXiv:2607.28679

Multi-Agent Planning with Spatio-Temporal and Topological Constraints using STL-GO

self-playreinforcement learningpublished Aug 3, 2026 · arXiv:2607.29468

Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember

LLM agentsbenchmarkingpublished Aug 3, 2026 · arXiv:2607.28956

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

large language model agentsscientific tool acquisitionpublished Aug 3, 2026 · arXiv:2607.28692

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

agent systemsfailure taxonomiespublished Aug 3, 2026 · arXiv:2607.28802

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

agentic AIautonomous AI agentspublished Aug 3, 2026 · arXiv:2607.28629

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

AI agent detectionbot detectionpublished Jul 31, 2026 · arXiv:2607.26935

What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation

agentic AIdata qualitypublished Jul 31, 2026 · arXiv:2607.26313

SARC-DQ: Runtime Data-Quality Gating for Agentic AI: Silent Evidence Defects, the Incompetence Shield, and Downstream-Only Remediation

autonomous offensive-security agentsoperational securitypublished Jul 31, 2026 · arXiv:2607.26314

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

LLM agentsskill optimizationpublished Jul 31, 2026 · arXiv:2607.26643

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

personalized agentsagent memorypublished Jul 31, 2026 · arXiv:2607.27056

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

LLM agentsoffice-suite workflowspublished Jul 31, 2026 · arXiv:2607.27155

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

large language model agentsmulti-agent systemspublished Jul 31, 2026 · arXiv:2607.26724

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks

AI agentslarge language modelspublished Jul 31, 2026 · arXiv:2607.26367

Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?

AI agentshuman-agent interactionpublished Jul 31, 2026 · arXiv:2607.26300

AgentGUI: An Interface for Observing and Steering Long-Running AI Agents

multi-agent debatelarge language modelspublished Jul 31, 2026 · arXiv:2607.26212

Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges

agentic searchlarge language model evaluationpublished Jul 31, 2026 · arXiv:2607.26070

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

AI agentstrustworthy sciencepublished Jul 31, 2026 · arXiv:2607.26064

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

large language modelschatbotspublished Jul 31, 2026 · arXiv:2607.26060

Large-Scale ChatBot Validation Through Customer Digital Twin Simulations

physics-informed neural networkspartial differential equationspublished Jul 31, 2026 · arXiv:2607.26490

EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

multi-agent systemsLLM alignmentpublished Jul 31, 2026 · arXiv:2607.26120

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

agentic systemslarge language modelspublished Jul 31, 2026 · arXiv:2607.26181

GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure

Show more