Sens.aiAI signal desk
TodayRadarBriefing
Admin sign in
Sens.aiSensif.aiAI signal desk
ModelsResearchCountriesOpen vs ClosedComputeBetaCommentary
Loading…
TodayRadarBriefingAdmin

Radar

Research Radar

Which research topics are accelerating, and where earlier papers have already landed in shipped models.

Filtered to Other — 300 papersClear filter

More papers match this topic — see “Show more” below.

Papers this week

50

Trending topic

Agents

▲ 26%

papers this window vs prior window

Papers linked to models

152

linked by the desk, past 90 days

Median days paper → model

—

lower is faster

Topic velocity

papers this window by topic · Δ vs prior window · a paper can carry more than one topic

AgentsAgents
138▲26%
Evaluation & BenchmarksEvaluation & Benchmarks
37▲37%
MultimodalMultimodal
24▼27%
Safety & Alignment

Topic momentum

prior window → this window

Agents

138 this window ▲26%

Evaluation & Benchmarks

37 this window ▲37%

Multimodal

24 this window ▼27%

Where research lands: paper → model linkage

Links are AI-inferred by the desk's LLM from tech reports, system cards and citations — each carries a confidence level and is not a claim by the authors.

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

arXiv:2608.04032AI-inferred · high

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

arXiv:2608.04205AI-inferred · high

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

arXiv:2608.04240AI-inferred · high

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

Filtered to Other — 300 papersClear filter

More papers match this topic — see “Show more” below.

Papers on Other

Clear filter
synthetic clinical dataoncologypublished Aug 25, 2026 · arXiv:2608.22085

Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation

large language modelsgeothermal energypublished Aug 25, 2026 · arXiv:2608.22068

Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays

Safety & Alignment
24▲60%
Efficiency & InferenceEfficiency & Inference
210%
Training & OptimizationTraining & Optimization
21▲50%
ReasoningReasoning
13▲18%
InterpretabilityInterpretability
11▼27%
Reinforcement LearningReinforcement Learning
10▼29%
Retrieval & RAGRetrieval & RAG
8▼27%
Code GenerationCode Generation
8▼27%
Privacy & SecurityPrivacy & Security
7▲250%
Generative ModelsGenerative Models
7▼53%
Robotics & Embodied AIRobotics & Embodied AI
70%
Language UnderstandingLanguage Understanding
5▲25%
Speech & AudioSpeech & Audio
5▼17%
Mixture of ExpertsMixture of Experts
3▲50%
Long ContextLong Context
3▼40%
Computer VisionComputer Vision
2▼75%
Data & Synthetic DataData & Synthetic Data
1▼75%
OtherOther
163▲11%
View as table
TopicPapers this windowPrior windowΔ
Agents138110+26%
Evaluation & Benchmarks3727+37%
Multimodal2433-27%
Safety & Alignment2415+60%
Efficiency & Inference21210%
Training & Optimization2114+50%
Reasoning1311+18%
Interpretability1115-27%
Reinforcement Learning1014-29%
Retrieval & RAG811-27%
Code Generation811-27%
Privacy & Security72+250%
Generative Models715-53%
Robotics & Embodied AI770%
Language Understanding54+25%
Speech & Audio56-17%
Mixture of Experts32+50%
Long Context35-40%
Computer Vision28-75%
Data & Synthetic Data14-75%
Other163147+11%

Safety & Alignment

24 this window ▲60%

Efficiency & Inference

21 this window ▲0%

Training & Optimization

21 this window ▲50%
arXiv:2608.05141
AI-inferred · high

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

arXiv:2608.04719AI-inferred · high

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv:2608.05144AI-inferred · high

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

arXiv:2608.04030AI-inferred · high

Recursive Synthesis for Long-Horizon Terminal Tasks

arXiv:2608.05466AI-inferred · high

Otter: A Time-Aware, History-Conditioned Human Chess AI

arXiv:2608.05206AI-inferred · high

ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation

arXiv:2608.05893AI-inferred · high

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

arXiv:2608.06110AI-inferred · high

SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

arXiv:2608.05212AI-inferred · high
claude-fable-5, claude-sonnet-5, claude-opus-53 links
GPT-5.67 links
OctoLong-Instruct1 link
Gemini 3.7 Flash1 link
Qwen 3.8 Max1 link
Otter1 link
View as table
PaperLinked modelRelationConfidence
EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis (2608.04032)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates85%
MatrAIx: Simulating the World with 8.3 Billion Persona Agents (2608.04205)GPT-5.6technique used95%
MatrAIx: Simulating the World with 8.3 Billion Persona Agents (2608.04205)claude-fable-5, claude-sonnet-5, claude-opus-5technique used95%
Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary (2608.04240)GPT-5.6evaluates100%
OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling (2608.05141)OctoLong-Instructevaluates98%
Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools (2608.04719)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning (2608.05144)GPT-5.6evaluates98%
NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts (2608.04030)Gemini 3.7 Flashevaluates99%
NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts (2608.04030)GPT-5.6evaluates99%
Recursive Synthesis for Long-Horizon Terminal Tasks (2608.05466)Qwen 3.8 Maxtechnique used98%
Otter: A Time-Aware, History-Conditioned Human Chess AI (2608.05206)Otterrelated100%
ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation (2608.05893)GPT-5.6technique used98%
ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment (2608.06110)GPT-5.6evaluates85%
SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents (2608.05212)GPT-5.6evaluates98%
StepReflect: Structured UI Transition Reflection for Mobile GUI Agents (2608.05587)GPT-5.6evaluates95%
Runtime Observability for Heterogeneous Attention Memory (2608.05863)DeepSeek V4-Flashrelated90%
Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index (2608.05411)Gemini 3.7 Flashevaluates99%
Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index (2608.05411)GPT-5.6evaluates99%
C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models (2608.05381)Gemini 3.7 Flashevaluates98%
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation (2608.05628)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation (2608.05628)GPT-5.6evaluates98%
Counterfactual Analysis via Large Language Models (2608.05367)GPT-5.6evaluates98%
EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents (2608.05519)GPT-5.6evaluates95%
Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints (2608.06949)GPT-5.6evaluates98%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)Grokevaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)Gemini 3.7 Flashevaluates96%
Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays (2608.22068)GPT-5.6evaluates96%
MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning (2608.22167)GPT-5.6technique used95%
Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems (2608.22143)Qwen 3.8 Maxevaluates98%
Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems (2608.22143)Gemma 4evaluates98%
GenCoord: Skill-Path Commitments under Private Information (2608.22055)Qwen 3.8 Maxtechnique used98%
More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning (2608.22048)Qwen 3.8 Maxevaluates100%
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (2608.22191)Qwen 3.8 Maxevaluates98%
Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (2608.22191)GPT-5.6evaluates98%
Redteaming Leading Arabic LLMs with ASAS (2608.21985)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Redteaming Leading Arabic LLMs with ASAS (2608.21985)GPT-5.6evaluates98%
Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning (2608.22128)Gemini 3.7 Flashevaluates95%
MEMORY Wins All: Indirect Bias Injection Attacks via Social Media Feeds (2608.22061)GPT-5.6evaluates95%
HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews (2608.21868)Qwen 3.8 Maxtechnique used99%
Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning (2608.21811)Qwen 3.8 Maxevaluates98%
HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries (2608.21792)Qwen 3.8 Maxtechnique used99%
ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling (2608.21712)Athena-Brain-8Btechnique used99%
Context as an Environment: Programmatic Context Management for Long-Horizon Agents (2608.21690)Qwen 3.8 Maxevaluates95%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)GPT-5.6evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)Gemini 3.7 Flashevaluates98%
Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning (2608.21501)Qwen 3.8 Maxevaluates99%
KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference (2608.21362)Qwen 3.8 Maxevaluates98%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)GPT-5.6evaluates100%
IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents (2608.06735)DeepSeek-V4-Flash-0731evaluates95%
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs (2608.07167)GPT-5.6evaluates98%
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader (2608.06474)GPT-5.6evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)GPT-5.6evaluates99%
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory (2608.07169)GPT-5.6 Lunatechnique used98%
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills (2608.07885)GPT-5.6 Lunaevaluates98%
SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents (2608.08055)DeepSeek-V4-Flash-0731technique used98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)DeepSeek-V4-Flash-0731evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GLM-5.3evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GPT-5.6 Lunaevaluates98%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)GPT-5.6 Lunaevaluates99%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)Gemini 3.7 Flashevaluates99%
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines (2608.07813)DeepSeek-V4-Flash-0731evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Grok 4.6evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)GPT-5.6 Lunaevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Gemini 3.7 Flashevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Can Legal AI Know When It Is Wrong? And Do Students Know When It Is? (2608.21089)GPT-5.6 Lunaevaluates99%
Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol (2608.20729)Qwen 3.8 Maxevaluates98%
Why2Speak: Faithful Reasoning for Abstaining Action Policies (2608.20670)Qwen 3.8 Maxevaluates98%
No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators (2608.20938)Qwen 3.8 Maxevaluates99%
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation (2608.20797)Qwen 3.8 Maxtechnique used98%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)GPT-5.6 Lunaevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Qwen 3.8 Maxevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Gemma 4evaluates99%
Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design (2608.20755)GPT-5.6 Lunatechnique used95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Gemma 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Mistral OCR 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Qwen 3.8 Maxevaluates95%
Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory (2608.20397)Qwen 3.8 Maxevaluates99%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Gemma 4evaluates98%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Qwen 3.8 Maxevaluates98%
PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure (2608.20342)claude-fable-5, claude-sonnet-5, claude-opus-5technique used98%
Personalized Privacy Control in LLMs via Attention Head Intervention (2608.21209)Qwen 3.8 Maxevaluates99%
TreeWY: Speculative Verification for Gated DeltaNet Hybrids (2608.20961)Qwen 3.8 Maxevaluates98%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Gemma 4evaluates99%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Qwen 3.8 Maxevaluates99%
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth (2608.20574)Grok 4.6evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)GPT-5.6 Lunaevaluates99%
SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation (2608.10775)GPT-5.6 Lunaevaluates98%
CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation (2608.10090)DeepSeek-V4-Flash-0731evaluates98%
DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments? (2608.10366)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (2608.11341)GPT-5.6 Lunaevaluates98%
AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research (2608.11216)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
MBA: Multimodal Benchmark and Agents for Real-World Business Ideation (2608.11616)GPT-5.6 Lunatechnique used98%
When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs (2608.11403)Qwen 3.8 27Bevaluates99%
XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication (2608.11676)Qwen 3.8 27Bevaluates95%
Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges (2608.12097)GPT-5.6 Lunaevaluates95%
HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting (2608.11692)Qwen 3.8 27Bevaluates99%
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning (2608.11994)GPT-5.6 Lunaevaluates95%
From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate (2608.11381)Qwen 3.8 27Btechnique used98%
Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets (2608.11233)Qwen 3.8 27Btechnique used99%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)GPT-5.6 Lunaevaluates95%
FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents (2608.11683)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (2608.12036)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates86%
Harnessing agent memory to build lifelong AI partners for materials scientists (2608.11224)GPT-5.6 Lunaevaluates95%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)GPT-5.6 Lunaevaluates99%
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS (2608.12249)claude-fable-5, claude-sonnet-5, claude-opus-5technique used95%
Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration (2608.11210)Qwen 3.8 27Bevaluates95%
From Monolithic to Modular: Segment-level Automatic Prompt Optimization (2608.11219)GPT-5.6 Lunaevaluates98%
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle (2608.11241)claude-fable-5, claude-sonnet-5, claude-opus-5technique used90%
Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces (2608.12585)GPT-5.6 Lunaevaluates95%
Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes (2608.13420)Qwen 3.8 27Bevaluates98%
Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing (2608.13156)Qwen 3.8 27Bevaluates95%
Jointly Predicting Courses and Grades Using a Transformer-Based Model (2608.13409)trace-supervised symbolic neural CPUtechnique used99%
Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI) (2608.13063)Qwen 3.8 27Bevaluates99%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)AlphaEvolverelated94%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)GPT-5.6 Lunaevaluates98%
Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents (2608.12476)Qwen 3.8 27Bevaluates99%
Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs (2608.12675)Qwen 3.8 27Bevaluates95%
Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence (2608.12928)GPT-5.6 Lunaevaluates99%
From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL (2608.13787)GPT-5.6 Lunaevaluates95%
Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation (2608.13754)GPT-5.6 Lunaevaluates99%
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages (2608.14375)GPT-5.6 Lunaevaluates95%
MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends (2608.13883)GPT-5.6 Lunaevaluates95%
Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence (2608.13958)GPT-5.6 Lunaevaluates100%
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (2608.14290)Qwen 3.8 Maxrelated95%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)DeepSeek-V4-Flash-0731evaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)GPT-5.6 Lunaevaluates95%
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning (2608.14552)GPT-5.6 Lunaevaluates99%
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry (2608.14680)DeepSeek-V4-Flash-0731evaluates98%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)GPT-5.6 Lunatechnique used98%
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models (2608.15145)GPT-5.6 Lunaevaluates95%
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning (2608.14558)GPT-5.6 Lunaevaluates98%
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines (2608.14588)GPT-5.6 Lunaevaluates98%
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks (2608.14927)GPT-5.6 Lunaevaluates95%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)Qwen 3.8 Maxevaluates98%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)GPT-5.6 Lunaevaluates98%
When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models (2608.19230)GPT-5.6 Lunaevaluates98%
MidTool: Mid-training Data Synthesis for Agentic Tool Use (2608.20314)Qwen 3.8 Maxtechnique used98%
Automatic bioinformatic software named entity recognition from literature (2608.19201)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Grokevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Gemini 3.7 Flashevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)GPT-5.6 Lunaevaluates90%
Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping (2608.19220)GPT-5.6 Lunatechnique used99%
A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment (2608.19199)Athena-Brain-8Bevaluates98%
Phantom Gains: Auditing Self-Improvement Against a Measured Null (2608.20290)Qwen 3.8 Maxevaluates98%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)Gemini 3.7 Flashevaluates95%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)DeepSeek-V4-Flash-0731evaluates95%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)Gemini 3.7 Flashevaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)GPT-5.6 Lunaevaluates99%
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning (2608.19842)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)DeepSeek-V4-Flash-0731evaluates98%
From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG (2608.19535)Qwen 3.8 Maxevaluates99%
Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation (2608.19299)GPT-5.6 Lunaevaluates80%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Grokevaluates98%
Different Facets of Verbalised Overconfidence: an Interpretability Study (2608.18106)Qwen 3.8 Maxevaluates99%
DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models (2608.18103)DeepSeek V4-Flashtechnique used99%
Abliteration Mitigation via Refusal Aliases (2608.18093)Gemma 4evaluates99%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Gemma 4evaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Qwen 3.8 Maxevaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Mistral OCR 4evaluates85%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Qwen 3.8 Maxevaluates99%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Mistral OCR 4evaluates99%
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication (2608.19161)Qwen 3.8 Maxevaluates98%
Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference (2608.18591)Qwen 3.8 Maxtechnique used100%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)Qwen 3.8 Maxevaluates98%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair (2608.18324)Qwen 3.8 Maxevaluates98%
Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu (2608.18142)Mistral OCR 4evaluates99%
Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions (2608.18078)DeepSeek V4-Flashevaluates95%
Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS) (2608.18100)GPT-5.6 Lunaevaluates99%
Breaking the weakest link to evade vision language models (2608.18938)Qwen 3.8 Maxevaluates99%
Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models (2608.18884)Qwen 3.8 Maxevaluates98%
CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence (2608.18613)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (2608.18423)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)Qwen 3.8 Maxevaluates98%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)GPT-5.6 Lunaevaluates80%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Qwen 3.8 Maxevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Gemini 3.7 Flashevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)GPT-5.6 Lunaevaluates99%
Potential of ChatGPT in predicting stock market trends based on Twitter Sentiment Analysis (2311.06273)GPT-5.6 Lunaevaluates95%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)GPT-5.6 Lunaevaluates98%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)Gemini 3.7 Flashevaluates98%
Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch (2608.17684)Qwen 3.8 Maxevaluates98%
The Price of Thinking: Reasoning Effort as a Model-Specific API Contract (2608.16956)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing (2608.17638)GPT-5.6 Lunaevaluates95%
TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation (2608.17588)GPT-5.6 Lunaevaluates95%
Agent Lightning v1.0: Towards Harnessed Agentic RL (2608.17528)Qwen 3.8 Maxevaluates99%
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (2608.17393)Qwen 3.8 Maxevaluates99%
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration (2608.17336)Qwen 3.8 Maxevaluates98%
LinkedGrokclaude-fable-5, claude-sonnet-5, claude-opus-5Gemini 3.7 FlashGPT-5.6
heterogeneous graph neural networksmulti-objective rankingpublished Aug 25, 2026 · arXiv:2608.21979

Beyond Similarity: Heterogeneous Graph Learning for Multi-Objective Food Substitution in Charitable Food Agencies

clinical event-relation verificationretrieval-augmented generationpublished Aug 25, 2026 · arXiv:2608.22062

Search Broadly, Seek Evidence on Both Sides, Decide Narrowly: Evidence-Admissible GraphRAG for Longitudinal Clinical Event Verification

mixture-of-agentslarge language modelspublished Aug 25, 2026 · arXiv:2608.22176

Role-Specialized Mixture-of-Agents with Open-Weight LLMs for Clinical Prediction

retrieval-augmented generationreinforcement learningpublished Aug 25, 2026 · arXiv:2608.21925

ESCRAG-R1: Retrieval-Augmented Reinforcement Learning for Emotional Support Conversation

Model Context ProtocolLLM agentspublished Aug 25, 2026 · arXiv:2608.22063

From SQL Generation to Tool Selection: A Domain-Oriented Pattern for MCP Servers

scientific machine learningpartial differential equationspublished Aug 25, 2026 · arXiv:2608.22026

One-Step Evolution for Long-Time Extrapolation: An Error-Bound-Informed and Prior-Guided Neural Residual Framework for Autonomous PDEs

prompt optimizationskill optimizationpublished Aug 25, 2026 · arXiv:2608.22014

DynaContext: Self-Improving Dynamic Contextualization of Optimized Prompts for Heterogeneous Parameter Extraction

3D printingadditive manufacturingpublished Aug 25, 2026 · arXiv:2608.22128

Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning

LinkedGemini 3.7 Flash
graph machine learningadjacency matrix predictionpublished Aug 25, 2026 · arXiv:2608.21825

VisAdj: Learning Adjacency Matrices from Node-Link Images

retrieval-augmented classificationhuman-in-the-loop machine learningpublished Aug 25, 2026 · arXiv:2608.21792

HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries

LinkedQwen 3.8 Max
physics-informed neural networkshybrid neural learningpublished Aug 25, 2026 · arXiv:2608.21767

Physics-Knowledge-Guided Hybrid Neural Learning for Arctic Sea Ice Concentration Evolution and Short-Range Prediction

health misinformationdialogue systemspublished Aug 25, 2026 · arXiv:2608.21721

Ask or Answer: A Decision Framework for Multi-Turn Health Misinformation Intervention

large language modelseducational technologypublished Aug 25, 2026 · arXiv:2608.21668

From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation

LinkedGPT-5.6claude-fable-5, claude-sonnet-5, claude-opus-5Gemini 3.7 Flash
large language modelsalgorithmic discoverypublished Aug 25, 2026 · arXiv:2608.21584

Data-Driven Dynamic Algorithm Dispatch with Large Language Models

oral cancer screeningedge AIpublished Aug 25, 2026 · arXiv:2608.21583

Robust Lightweight Deep Learning Models for Oral Cancer Screening

knowledge graphsSHACL validationpublished Aug 25, 2026 · arXiv:2608.21418

Composable Trust Infrastructure for Manufacturing Knowledge Graphs: Cross-System Provenance, Temporal Reasoning, and Decision Traceability

root cause analysisdatacenter networkspublished Aug 25, 2026 · arXiv:2608.21412

The Abstention Protocol: RCA for Clos Fabrics

student burnoutstudy habit trackingpublished Aug 25, 2026 · arXiv:2608.21379

RIACT: A Responsible AI System for Personalized Study Habit Tracking and Early Burnout Signal Detection in University Students

AI governanceruntime decision auditingpublished Aug 25, 2026 · arXiv:2608.21363

AIREP: A Protocol for Per-Decision Evidence in AI Runtime Governance

domain adaptationgeographic domain shiftpublished Aug 25, 2026 · arXiv:2608.21567

Quantifying geographic domain shift to decouple the geospatial transferability of human mobility flow generation models

CLIPstreet-view imagerypublished Aug 25, 2026 · arXiv:2608.21761

What Does CLIP Learn for Regional Geolocalization? Probing Visual Cues and Scene Configuration After Adaptation

large language modelslegal AIpublished Aug 24, 2026 · arXiv:2608.21089

Can Legal AI Know When It Is Wrong? And Do Students Know When It Is?

LinkedGPT-5.6 Luna
flow matchingtransition-state predictionpublished Aug 24, 2026 · arXiv:2608.20869

ReCurveflow: A Flow Matching Framework that Learns Curved Reaction Trajectories to Predict Transition State Geometries

causal foundation modelspartial causal identificationpublished Aug 24, 2026 · arXiv:2608.20841

Foundation Models for Partial Causal Identification

graph neural networkscontinuous-time quantum walkspublished Aug 24, 2026 · arXiv:2608.20738

Continuous-Time Quantum Walks based Graph Neural Network

continual learningcatastrophic forgettingpublished Aug 24, 2026 · arXiv:2608.21044

Socialized Division and Collaboration: Rethinking Class-Incremental Learning under Optimization Conflicts

soft tissue simulationfinite element methodpublished Aug 24, 2026 · arXiv:2608.20967

Generalizing Soft Tissue Deformation and Force Prediction Across Material Stiffness and Geometry

physics-informed learningshape-constrained learningpublished Aug 24, 2026 · arXiv:2608.21059

The Cost of a Physics Prior Is Bounded by the Ablation Gap

SQLdatabase systemspublished Aug 24, 2026 · arXiv:2608.20630

SAGE: A Unified Algebra and Self-Adaptive Execution for AI Functions in SQL

semantic IDsautoregressive recommendationpublished Aug 24, 2026 · arXiv:2608.20611

Difficulty-Aware Semantic-ID Optimization for Generative Recommendation

model evaluationprediction certificationpublished Aug 24, 2026 · arXiv:2608.20825

Prediction certification cannot replace explanation certification: a competence envelope for trustworthy AI under compound stress

motion forecastingBayesian uncertainty estimationpublished Aug 24, 2026 · arXiv:2608.20802

SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers

multimodal learningvideo understandingpublished Aug 24, 2026 · arXiv:2608.20958

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

machine unlearningclaim-level knowledge removalpublished Aug 24, 2026 · arXiv:2608.20960

Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning

model specializationweight-delta analysispublished Aug 24, 2026 · arXiv:2608.20768

Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization

LinkedGPT-5.6 LunaQwen 3.8 MaxGemma 4
large language modelsprotein designpublished Aug 24, 2026 · arXiv:2608.20755

Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design

LinkedGPT-5.6 Luna
AI ethicsAI governancepublished Aug 24, 2026 · arXiv:2608.20490

Lost in Translation: How Universal Ethical Values Fail to Translate Across Global Contexts

agentic AIAI adoptionpublished Aug 24, 2026 · arXiv:2608.20425

Who Delegates to AI? Evidence from 53,000 Agent Configurations

artificial phenomenologycategorical mathematicspublished Aug 24, 2026 · arXiv:2608.20420

Categorical AI phenomenology: A first-person approach

IT change managementrisk assessmentpublished Aug 24, 2026 · arXiv:2608.21203

SENTRY: Deterministic, Intelligent Risk Assessment for IT Change Management

attention mechanismstoken presencepublished Aug 24, 2026 · arXiv:2608.21174

From Attention Masks to Inert Zero-Vector Tokens: OAttention and O-Closure for Token Dynamics

difference graph discoverycausal inferencepublished Aug 24, 2026 · arXiv:2608.21117

Root cause analysis via difference graph discovery from linear time-series data

multi-agent LLM systemsKV-cache translationpublished Aug 24, 2026 · arXiv:2608.20617

Dual-Cache Latent Space Communication between Heterogeneous Language Models

neural operatorsphysics-informed machine learningpublished Aug 24, 2026 · arXiv:2608.20477

STCO: Conditional Neural Operators for Time-Dependent PDEs

spiking neural networks3D point cloud recognitionpublished Aug 21, 2026 · arXiv:2608.19232

Active Spiking Perception: The Membrane Potential as a Belief State for Anytime 3D Point Cloud Recognition

language modelsliterature-search agentspublished Aug 21, 2026 · arXiv:2608.19230

When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models

LinkedGPT-5.6 Luna
AI regulationsystemic risk assessmentpublished Aug 21, 2026 · arXiv:2608.19278

Mapping General-Purpose AI Governance in Twenty AI Middle-Power Jurisdictions

bioinformaticsnamed entity recognitionpublished Aug 21, 2026 · arXiv:2608.19201

Automatic bioinformatic software named entity recognition from literature

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5GrokGemini 3.7 FlashGPT-5.6 Luna
uncertainty quantificationconfidence estimationpublished Aug 21, 2026 · arXiv:2608.19323

Improved Confidence Estimates for Black-Box Large Language Models

quantum machine learningquantum kernel methodspublished Aug 21, 2026 · arXiv:2608.19304

Quantum Kernel Estimation for the Discovery of Early Lung Cancer Detection

conversational AIintergroup relationspublished Aug 21, 2026 · arXiv:2608.19220

Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping

LinkedGPT-5.6 Luna
supervised machine learninghelicopter weight estimationpublished Aug 21, 2026 · arXiv:2608.19210

Towards On-Board Implementation of ML-Based Helicopter Weight Estimator

language model self-improvementself-trainingpublished Aug 21, 2026 · arXiv:2608.20290

Phantom Gains: Auditing Self-Improvement Against a Measured Null

LinkedQwen 3.8 Max
cryptocurrency fraudmemecoinspublished Aug 21, 2026 · arXiv:2608.20271

Catching the Rug: Early Prediction of Fraudulent Memecoins on Solana via Machine Learning

quantum-classical neural networksphysical-layer authenticationpublished Aug 21, 2026 · arXiv:2608.20240

QUASAR: A Quantum-Classical Neural Network for SAR Satellite Physical-Layer Authentication

electronic navigational chartsgeospatial vector datapublished Aug 21, 2026 · arXiv:2608.20218

Electronic Navigational Chart Change Classification

Software 3.0software architecturepublished Aug 21, 2026 · arXiv:2608.20201

The Third Restructuring of Software Form: From the Three-Tier Architecture to Storage, Models, and Agents

compositional generalizationmulti-module language-model systemspublished Aug 21, 2026 · arXiv:2608.20054

What You Can't See Is What You Learn: Restricted Evidence Visibility Favors Compositional Generalization in Shared-Genome Language-Model Societies

AI agencymoral agencypublished Aug 21, 2026 · arXiv:2608.20041

A three-dimensional typology of agency for advanced AI systems

trajectory forecastingphysical property estimationpublished Aug 21, 2026 · arXiv:2608.20009

ExPhy: A Benchmark for Explicit Physical Property Learning in Multi-Object Trajectory Forecasting

time series forecastingTransformer architecturespublished Aug 21, 2026 · arXiv:2608.19966

Rethinking Patch Based Multivariate Time Series Forecasting with Semantic Structured Partitioning

mixed-integer linear programmingcombinatorial optimizationpublished Aug 21, 2026 · arXiv:2608.19953

Learning Early-to-Final Solution Consistency for MILP Acceleration

cardiac computed tomographystatistical shape modelspublished Aug 21, 2026 · arXiv:2608.19932

A Strong Linear Baseline for Whole-Heart Cardiac Shape Completion on CT, with an Open Eleven-Structure Statistical Shape Model

spiking neural networksBayesian inferencepublished Aug 21, 2026 · arXiv:2608.19907

Spike-based Belief Propagation in Nonlinear Dynamical Systems

LLM architecturedomain-specific languagespublished Aug 21, 2026 · arXiv:2608.19889

Write Once, Run Everywhere: The Axon DSL for Shape-Safe and Framework-Agnostic LLM Architectures

robustness testingadversarial robustnesspublished Aug 21, 2026 · arXiv:2608.19882

TESTNAV: Pareto-Guided Search for Compositional Robustness Testing

specification-driven developmentAI-assisted software developmentpublished Aug 21, 2026 · arXiv:2608.19838

Specification-delta-driven data governance: an empirical study of the "spec-delta" as the unit of change in lakehouse data platforms

AI content creationeducational technologypublished Aug 21, 2026 · arXiv:2608.19812

When Saying No Makes Better Videos: Designing Dual Gatekeeping for Pedagogically Grounded AI Content Creation

tensor networkstensor-train decompositionpublished Aug 21, 2026 · arXiv:2608.19789

TT-net: Quantum Inspired Tensor Network Denoising in Conditional GANs

ride-hailingorder dispatchingpublished Aug 21, 2026 · arXiv:2608.19751

GenMatch: An End-to-End Generative Matching Framework for Micro-View Order-Dispatching in Ride-Hailing

large language modelscontinual learningpublished Aug 21, 2026 · arXiv:2608.19680

Frequency-Aware Continual Learning for Smart Contract Vulnerability Detection with Large Language Models

AI controlAI safetypublished Aug 21, 2026 · arXiv:2608.19216

Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model

artificial consciousnessAI valencepublished Aug 21, 2026 · arXiv:2608.19215

How to Navigate Uncertainty About AI Consciousness

geographic biasinstitutional prestige biaspublished Aug 20, 2026 · arXiv:2608.18107

Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals

low-resource languagesmultilingual language modelspublished Aug 20, 2026 · arXiv:2608.18094

NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages

model safetyabliterationpublished Aug 20, 2026 · arXiv:2608.18093

Abliteration Mitigation via Refusal Aliases

LinkedGemma 4
emotion representationvalence classificationpublished Aug 20, 2026 · arXiv:2608.18090

Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities

LinkedGemma 4Qwen 3.8 MaxMistral OCR 4
tokenizationnatural language processingpublished Aug 20, 2026 · arXiv:2608.18087

SuTRA : Structurally-Unified Tokenization with Root Awareness

frontier language modelsbenchmarkingpublished Aug 20, 2026 · arXiv:2608.19140

Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

LLM operationsAI system reliabilitypublished Aug 20, 2026 · arXiv:2608.19125

Tuning the Stochastic Machine: A Systems Engineer's Operating Model for Human-AI Engineering

Wasserstein ambiguity setsentropic value-at-riskpublished Aug 20, 2026 · arXiv:2608.19073

Robust Risk Under Evolving Uncertainty: A Wasserstein Counterpart of the Entropic Value-at-Risk

self-promptingcross-model consensuspublished Aug 20, 2026 · arXiv:2608.19025

Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models

deep learning testingmodel robustnesspublished Aug 20, 2026 · arXiv:2608.18900

TestifAI: Tomography-Based Testing for Deep Learning Systems

AI-assisted leak localizationverifiable abstentionpublished Aug 20, 2026 · arXiv:2608.18836

Verifiable abstention makes AI leak diagnosis accountable in water distribution networks

SARS-CoV-2variant detectionpublished Aug 20, 2026 · arXiv:2608.18238

GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks

lattice theorymetric spacespublished Aug 20, 2026 · arXiv:2608.18194

On the Triangle Inequality for the Jaccard Distance in Arbitrary Lattices

knowledge graphsRDFpublished Aug 20, 2026 · arXiv:2608.18165

RDFdL: Integrating RDF with Differential Dynamic Logic

Orientalismcultural sensitivitypublished Aug 20, 2026 · arXiv:2608.18100

Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS)

LinkedGPT-5.6 Luna
description logicsontology learningpublished Aug 20, 2026 · arXiv:2608.18899

Syntactic Simplification of OWL Class Expressions

enthymeme completionmissing-premise selectionpublished Aug 20, 2026 · arXiv:2608.18820

Pairwise Logical Selection of Enthymeme Completions under Semantic-Link Uncertainty

AutoMLAutoDLpublished Aug 20, 2026 · arXiv:2608.18665

Candidate-Fate Accounting for Transparent Sensor Diagnostic Pipeline Search

fuzzy logicpower transformerspublished Aug 20, 2026 · arXiv:2608.18133

Optimized Fuzzy Logic Approach with the IEEE Key Gas Method for Diagnosing Power Transformer Faults Using Dissolved Gas Analysis

drone safetypropeller fault detectionpublished Aug 20, 2026 · arXiv:2608.18088

A Metamorphic Artificial Age Score Decision-Support Prototype for Flight-Log-Based Drone Propeller Health Monitoring

model cardsacceptable use policiespublished Aug 20, 2026 · arXiv:2608.18086

Position: Current Model Cards Are Insufficient for Downstream Governance of Open-Weight Foundation Models

mental healthclinical conversational agentspublished Aug 20, 2026 · arXiv:2608.18080

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

traffic congestionvehicle reroutingpublished Aug 19, 2026 · arXiv:2608.18056

HLSR: Hybrid Live Forecast Selective Dynamic Vehicle Rerouting for Real-Time Congestion Avoidance

AI educationAI literacypublished Aug 19, 2026 · arXiv:2608.16896

What If AI Carried Her Imagination? Black Girls as Creators in an AI Storytelling Weekend Program

large language modelsexecutable program generationpublished Aug 19, 2026 · arXiv:2608.17947

Procedural Content Metageneration via Program Search and Continual Abstraction Discovery

reinforcement learningMarkov decision processespublished Aug 19, 2026 · arXiv:2608.17929

Adaptive Policy Portfolios for Robust Markov Decision Processes

autonomous researchmulti-agent systemspublished Aug 19, 2026 · arXiv:2608.17906

AutoResearch: Insight In, Hallucination Out

in-context learningfew-shot promptingpublished Aug 19, 2026 · arXiv:2608.17856

ARASH: Adaptive Retrieval And Shot Selection for Tabular Prediction

multi-agent decision makingpartial observabilitypublished Aug 19, 2026 · arXiv:2608.17749

The Curious Case of Exploding DecPOMDPs: Containing the Fire through Policy Counting

model cascadesconfidence-based routingpublished Aug 19, 2026 · arXiv:2608.17711

Accuracy and Robustness of Model Cascades Under Data Perturbations

causal inferencedo-operatorpublished Aug 19, 2026 · arXiv:2608.17634

Graph Surgery and the Do-Operator: A Precise Correspondence for Acyclic Structural Causal Models

reinforcement learningrobust decision makingpublished Aug 19, 2026 · arXiv:2608.17574

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

AI scientistsresearch problem formulationpublished Aug 19, 2026 · arXiv:2608.17501

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

large language modelspreference modelingpublished Aug 19, 2026 · arXiv:2608.17644

LLM-Derived Preference Judgments Are Not Self-Consistent

large language modelsstoryboard generationpublished Aug 19, 2026 · arXiv:2608.17468

SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution

deep neural networksReLU regressionpublished Aug 19, 2026 · arXiv:2608.17434

Depth Enables Local Entropy: Quadratic Depth Dependence in Deep Variation-Norm ReLU Regression

graph analyticsgraph samplingpublished Aug 19, 2026 · arXiv:2608.16916

Average Distance Approximation for Static Large Graphs

algorithmic biasAI-generated financial advicepublished Aug 19, 2026 · arXiv:2608.16909

When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice

LinkedGrok
graph algorithmscommunity detectionpublished Aug 19, 2026 · arXiv:2608.16906

ComNetX: Local Hierarchical Adaptation for Dynamic Community Detection

neuro-symbolic learningOWL 2 DLpublished Aug 19, 2026 · arXiv:2608.17741

Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits

domain adaptationaerial crowd countingpublished Aug 19, 2026 · arXiv:2608.17625

Validated Adaptation for Aerial Crowd Monitoring at Mass Gathering Scale: A Deployment Protocol, a Severity Law, and a Diagnostic for Label-Free Drone Crowd Counting, Toward the FIFA World Cup 2034 (Saudi Arabia)

human-AI collaborationmathematical researchpublished Aug 19, 2026 · arXiv:2608.16977

The Problem Is the Problem: Towards Scalable Mathematical Discovery

federated learningpreference learningpublished Aug 19, 2026 · arXiv:2608.16971

FedPref: Federated Preference Learning for Structured Radiology Report Extraction

large language modelsagentic systemspublished Aug 19, 2026 · arXiv:2608.17170

Synthesizing Feature Extractors: An Agentic Approach for Algorithm Selection

LLM evaluationuser simulationpublished Aug 19, 2026 · arXiv:2608.17150

KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn

personal AIuser modelingpublished Aug 19, 2026 · arXiv:2608.17128

Toward Personal Intelligence Through Cooperative Observation

hidden-state selectionmajority votingpublished Aug 19, 2026 · arXiv:2608.17124

A decodability criterion predicts when hidden-state selection beats majority voting in large language models

machine learningcovert consciousness detectionpublished Aug 19, 2026 · arXiv:2608.16903

AI, Brain Death Detection, and Islamic Law

adaptive bitrate streaminglarge language modelspublished Aug 18, 2026 · arXiv:2608.15138

ReForge: Keeping ABR Algorithms Never Finished with Verified Large Language Model Edits

platform governanceactor best-response modelingpublished Aug 18, 2026 · arXiv:2608.15131

Platform Adaptation Under Governance Interventions: Actor Best-Response Modeling and an External Public-Case Benchmark

machine learningrepresentation selectionpublished Aug 18, 2026 · arXiv:2608.15095

Validation-Frontier Representation Selection under Constrained Observation

cold chain IoTshelf-life predictionpublished Aug 18, 2026 · arXiv:2608.15082

Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems

hypergraph learninglanguage modelspublished Aug 18, 2026 · arXiv:2608.15055

TAHB: A Comprehensive Benchmark for Text-Attributed Hypergraph Learning

large language modelshierarchical controlpublished Aug 18, 2026 · arXiv:2608.15041

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

tool useretrieval-augmented systemspublished Aug 18, 2026 · arXiv:2608.14992

Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5

vertiport sitingeVTOL fleet simulationpublished Aug 18, 2026 · arXiv:2608.14974

Demand-Driven Vertiport Siting and Discrete-Event Fleet Simulation for On-Demand Urban Air Mobility Network Design

opioid use disorderwearable sensingpublished Aug 18, 2026 · arXiv:2608.14947

RETRACE: Resilience-Guided Trait-Conditioned Craving Estimation from Wearable Physiology in Opioid Use Disorder

AI co-scientistsautomated scientific researchpublished Aug 18, 2026 · arXiv:2608.14881

Personalized Auto-Research: Towards a True AI Co-Scientist

large language modelsmulti-turn interactionpublished Aug 18, 2026 · arXiv:2608.14808

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

low-Earth-orbit satellite constellationsEarth observationpublished Aug 18, 2026 · arXiv:2608.14789

Task-Driven Three-Layer Distributed Scheduling for Emergency Earth Observation in Large Low-Earth-Orbit Constellations

wireless foundation models6G networkspublished Aug 18, 2026 · arXiv:2608.14694

A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks

quantum parallel repetitionentangled gamespublished Aug 18, 2026 · arXiv:2608.14673

Auditing an AI-Generated Mathematical Proof: A Correction to a Greedy Conditioning Lemma in Quantum Parallel Repetition

industrial fault detectioncoupling faultspublished Aug 18, 2026 · arXiv:2608.14666

Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring

code generationuncertainty estimationpublished Aug 18, 2026 · arXiv:2608.14659

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

large language modelscosmetic chemistrypublished Aug 18, 2026 · arXiv:2608.14631

Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: A Benchmarking Study

medical AItreatment outcome predictionpublished Aug 18, 2026 · arXiv:2608.14598

Position: Medical AI Neglects Real Treatment Outcomes

longitudinal machine learninggraph neural networkspublished Aug 18, 2026 · arXiv:2608.14578

Longitudinal and Graph-Augmented Prediction of Adolescent Substance Use Onset in the ABCD Study

machine learningpeer reviewpublished Aug 18, 2026 · arXiv:2608.14571

Position: Want Better ML Reviews? Stop Asking Nicely and Start Incentivizing with a Credit System

AI governanceinteroperability protocolspublished Aug 18, 2026 · arXiv:2608.14568

Position: AI Governance Needs ISO-like Interoperability Protocols, Not Just Laws

belief revisionAGM frameworkpublished Aug 18, 2026 · arXiv:2608.14567

From Doyle to AGM: A Survey and an Implementation Roadmap for Belief Change

AI regulationAI ethicspublished Aug 18, 2026 · arXiv:2608.14562

Global AI Regulations for FAIR and Ethics in High-Risk Use Cases: A Comparative Review

steganographycovert communicationpublished Aug 18, 2026 · arXiv:2608.14697

Synchronized Logit Steering: Real-world Steganography

second-order policy effectsbenchmark evaluationpublished Aug 18, 2026 · arXiv:2608.15101

Second-Order Policy Effects as State Transitions: A Source-Linked Benchmark for Policy Simulation

Lean 4formal mathematicspublished Aug 18, 2026 · arXiv:2608.14669

Beyond Correctness: Toward Automated Novelty Verification with Lean 4

medical reasoningclinical diagnosispublished Aug 18, 2026 · arXiv:2608.14552

Large Language Models Show Metacognitive Sensitivity in Medical Reasoning

LinkedGPT-5.6 Luna
causal self-attentionsequential recommendationpublished Aug 17, 2026 · arXiv:2608.14021

Residual Dominance as a Structural Account of Last-Item Reliance in Causal Self-Attention Recommenders

reinforcement learningproduction schedulingpublished Aug 17, 2026 · arXiv:2608.14122

Reinforcement Learning-Based Production Scheduling in an Industry-Based Coating Scenario Using the Digital Model Playground

Joint-Embedding Predictive Architecturehidden Markov modelspublished Aug 17, 2026 · arXiv:2608.13621

Your Probabilistic JEPA Is Secretly a Hidden Markov Model: A State-Space Interpretation of Joint-Embedding Predictive Learning

neuro-symbolic AIlarge language modelspublished Aug 17, 2026 · arXiv:2608.13617

How Compliant is Sepsis Treatment? An Expert-Guided Neuro-symbolic Pipeline for Generating Clinical Compliance Insights

federated learningneural architecture searchpublished Aug 17, 2026 · arXiv:2608.14359

Designing Sustainable Federated Learning as a Service using Neural Architecture Search

spatial transcriptomicshistologypublished Aug 17, 2026 · arXiv:2608.14330

Program-space Diffusion for Morphology-to-Transcriptomics Prediction

groundingcorrective controlpublished Aug 17, 2026 · arXiv:2608.14252

Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models

spectral foundation modelsRaman spectroscopypublished Aug 17, 2026 · arXiv:2608.14227

Attributing Preprocessing Invariance in Spectral Foundation Models

Lean 4Mathlibpublished Aug 17, 2026 · arXiv:2608.14221

MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement

proportional analogiesRiemannian manifoldspublished Aug 17, 2026 · arXiv:2608.14220

A Generalized Parallelogram Rule for Proportional Analogies on Riemannian Manifolds

AI governanceformal logicpublished Aug 17, 2026 · arXiv:2608.13958

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

LinkedGPT-5.6 Luna
MCMCmulti-fidelity methodspublished Aug 17, 2026 · arXiv:2608.13774

FLARE MCMC: Fidelity-based Layer-Adaptive REcursive proposals for MCMC

conceptual scalingfactor latticespublished Aug 17, 2026 · arXiv:2608.13630

Exploring ESC Winners with Nested Diagrams

healthcare AIalgorithmic disparitypublished Aug 17, 2026 · arXiv:2608.13618

Algorithm Design and Physician Liability

confidence calibrationmiscalibrationpublished Aug 17, 2026 · arXiv:2608.13591

Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

LLM servingproduction workload characterizationpublished Aug 17, 2026 · arXiv:2608.13573

A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

large language modelscognitive modularitypublished Aug 17, 2026 · arXiv:2608.13567

Modular Cognitive Architecture Emerges in Large Language Models

LLM evaluationBayesian inferencepublished Aug 17, 2026 · arXiv:2608.14425

Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations

AI scientistsautonomous scientific discoverypublished Aug 17, 2026 · arXiv:2608.14407

The Past and Future of AI Scientists

financial newsmarket microstructurepublished Aug 17, 2026 · arXiv:2608.14014

Buy the Rumor, Sell the News: When Is News Priced In?

text-to-SQLnatural language interfaces to databasespublished Aug 17, 2026 · arXiv:2608.13926

Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact

LLM evaluationmodel regressionpublished Aug 17, 2026 · arXiv:2608.13607

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

misunderstanding generationmisunderstanding amplificationpublished Aug 17, 2026 · arXiv:2608.13604

Cross-Disciplinary Taxonomy and Modeling of Misunderstanding Generation, Amplification, and Detection, from Pragmatics to AI Agents

content depth evaluationrecommendation systemspublished Aug 17, 2026 · arXiv:2608.13990

Content Depth Matters in Short-Video Recommendation: Rethinking the Attention Economy

AI agentsruntime harnessespublished Aug 17, 2026 · arXiv:2608.13951

HELIX: Model-Harness Co-evolution for Recursive Self-Improvement

freezing of gaitParkinson's diseasepublished Aug 15, 2026 · arXiv:2608.13283

Towards Context-Aware Clinical Motion Understanding in Daily Living at Home: Freezing of Gait Detection with Egocentric Vision

Dempster-Shafer theoryevidence fusionpublished Aug 15, 2026 · arXiv:2608.13108

Robust Dempster-Shafer Evidence Fusion with Chaos-Conflict Measurement and Historical-Experience Weighting

measure-theoretic probabilistic logiccontinuous probabilistic modelspublished Aug 15, 2026 · arXiv:2608.13018

Foundations of MT-PDCL: Measure-Theoretic Probabilistic Definite Clause Logic

OWL 2 ELneuro-symbolic learningpublished Aug 15, 2026 · arXiv:2608.12961

Moose: Latent concept learning with reasoning-shortcut awareness in \(\mathcal{EL}^{++}\)

electroencephalographyEEG foundation modelspublished Aug 15, 2026 · arXiv:2608.13072

EEG-PRIME: Prototype-Aligned Representation Learning with Multi-Level Conditioning for EEG Decoding

IT service managementlarge language modelspublished Aug 15, 2026 · arXiv:2608.12670

Designing AI Pipelines for Decision-Ready ITSM Intelligence

LLM evaluationmechanical consistencypublished Aug 15, 2026 · arXiv:2608.12645

Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

AI benchmarksagentic AIpublished Aug 15, 2026 · arXiv:2608.12593

DiG-bench: Discovery in Games

LLM program evolutionalgorithm discoverypublished Aug 15, 2026 · arXiv:2608.12522

ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution

LinkedAlphaEvolveGPT-5.6 Luna
LLM personalizationmeta-learningpublished Aug 15, 2026 · arXiv:2608.12389

Learning to Adapt Cross-Domain Preferences via Meta-LoRA for LLM Personalization

transformerslarge language modelspublished Aug 15, 2026 · arXiv:2608.12671

On the Expressive Power of Transformers

anomaly detectionexplanatory engagementpublished Aug 15, 2026 · arXiv:2608.13063

Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI)

LinkedQwen 3.8 27B
class-incremental learningexemplar replaypublished Aug 15, 2026 · arXiv:2608.13061

Uniform Herding: Exemplar Replay with Representation Refresh

artificial intelligence readiness levelsLLM-based classificationpublished Aug 15, 2026 · arXiv:2608.13428

RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level

transformer modelsstudent performance predictionpublished Aug 15, 2026 · arXiv:2608.13409

Jointly Predicting Courses and Grades Using a Transformer-Based Model

Linkedtrace-supervised symbolic neural CPU
KV cache reclamationtoken-level virtualizationpublished Aug 15, 2026 · arXiv:2608.13263

vToken: Token-Level Virtualization for Reclaimable KV Caches

large language model safetyconstraint followingpublished Aug 15, 2026 · arXiv:2608.12599

Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

instruction followingconstraint satisfactionpublished Aug 15, 2026 · arXiv:2608.12426

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

large language modelsformal verificationpublished Aug 15, 2026 · arXiv:2608.12762

PROVE-RT: Generating Mechanized Theorem Prover Scripts for Real-Time Systems using LLMs

large language modelsevolution strategiespublished Aug 15, 2026 · arXiv:2608.12679

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

artificial intelligence educationproject-based learningpublished Aug 15, 2026 · arXiv:2608.13447

Academic League of Artificial Intelligence - An Integrative Perspective of Teaching, Research, and Extension

activation steeringmemory localizationpublished Aug 15, 2026 · arXiv:2608.12892

Predictive Memory Localization: Forecasting Selective Intervention Paths from Internal Signals

self-reflective agentsevidence-grounded reasoningpublished Aug 15, 2026 · arXiv:2608.12877

ReflectFact: Self-Reflective Agents for Improving Comprehension and Reasoning in Multi-Hop Fact Verification

consumer protectionAI liabilitypublished Aug 15, 2026 · arXiv:2608.12863

AI and Consumer Rights in India Working Paper

Bayesian updatingprobability distributionspublished Aug 13, 2026 · arXiv:2608.11724

Proportional Analogies on Probability Distributions via Bayesian Updating

generative AIeducational technologypublished Aug 13, 2026 · arXiv:2608.11625

Making AI-Generated Feedback Matter: From Provision to Student Enactment

protein structure predictionfoundation modelspublished Aug 13, 2026 · arXiv:2608.12192

How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

symbolic machine learningvapor-liquid equilibriumpublished Aug 13, 2026 · arXiv:2608.11255

Symbolic Machine Learning for Vapor-Liquid Equilibrium Prediction in Cx-N2 Binary Mixtures

large language modelsmulti-agent collaborationpublished Aug 13, 2026 · arXiv:2608.11247

Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier

neural operatorspartial differential equationspublished Aug 13, 2026 · arXiv:2608.11237

Geometry-aware Incremental Neural Operator for Long-Horizon PDE prediction

cyber-physical systemssimulationpublished Aug 13, 2026 · arXiv:2608.11221

A Conceptual Framework for Refining Influence Knowledge from Simulation Evidence in Cyber-Physical Systems

strongly regular graphsConway's 99-graph problempublished Aug 13, 2026 · arXiv:2608.11211

A Forced-Structure Reduction and Verifiable Bounds for Conway's 99-Graph

Bayesian calibrationagentic systemspublished Aug 13, 2026 · arXiv:2608.11210

Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration

LinkedQwen 3.8 27B
recurrent depthlatent reasoningpublished Aug 13, 2026 · arXiv:2608.11233

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

LinkedQwen 3.8 27B
agentic LLMsdigital twinspublished Aug 13, 2026 · arXiv:2608.11679

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

large language modelsactive clarificationpublished Aug 13, 2026 · arXiv:2608.11631

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

recommender systemsinverse theory of mindpublished Aug 13, 2026 · arXiv:2608.11354

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

temporal anomaly groundingmultimodal large language modelspublished Aug 13, 2026 · arXiv:2608.11260

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

edge-based contiguous p-median problemlogistics districtingpublished Aug 13, 2026 · arXiv:2608.11230

The Edge-based Contiguous p-median Problem with Connections to Logistics Districting

comparative feedbackpreference learningpublished Aug 13, 2026 · arXiv:2608.11229

Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)

AI personality clonespersonal identitypublished Aug 13, 2026 · arXiv:2608.11225

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

large language modelsprocess flow diagramspublished Aug 13, 2026 · arXiv:2608.11220

LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs

AI agentshuman-AI collaborationpublished Aug 12, 2026 · arXiv:2608.11195

Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration

knowledge graphsurban datapublished Aug 12, 2026 · arXiv:2608.11080

RTSKG: Building a Rail Transit Station Knowledge Graph Dataset

federated learningcross-domain recommendationpublished Aug 12, 2026 · arXiv:2608.10929

FedCGR: Federated Cross-Domain Generative Recommendation

information operationsinfluence campaignspublished Aug 12, 2026 · arXiv:2608.10920

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

Euclidean Traveling Salesperson ProblemConstraint Logic Programmingpublished Aug 12, 2026 · arXiv:2608.10881

Enhanced Filtering Algorithms for the Euclidean Traveling Salesperson Problem and its variants in Constraint Logic Programming

neurosymbolic reasoningverifier-guided LLM generationpublished Aug 12, 2026 · arXiv:2608.10843

Hypothesis Frontier: Verifier Guided LLM and Symbolic Search for First-Order Induction

persistent memorycode optimizationpublished Aug 12, 2026 · arXiv:2608.10795

EvoMem: Memory-Augmented Evolution for Code Optimization

autonomous chemistryagent experimentationpublished Aug 12, 2026 · arXiv:2608.10792

ChemWorld: Programmable Chemical Worlds for Controlled and Replayable Agent Experimentation

multimodal dialoguespeech synthesispublished Aug 12, 2026 · arXiv:2608.10720

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

structural causal modelscausal inferencepublished Aug 12, 2026 · arXiv:2608.10664

Operationalising Relative Causal Knowledge: Backbone Identifiability from Private Reports on a Shared Outcome

scholar assessmentlarge language modelspublished Aug 12, 2026 · arXiv:2608.10584

HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment

instruction data curationagentic AIpublished Aug 12, 2026 · arXiv:2608.10579

Agentic Instruction Data Selection: Let DataMaster Interpret Your Intent

radiologymedical AIpublished Aug 12, 2026 · arXiv:2608.10505

RadFusion: Towards Threshold-Controllable Radiology Report Generation

student modelinglatent reasoningpublished Aug 12, 2026 · arXiv:2608.10492

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

molecular language modelsgraph neural networkspublished Aug 12, 2026 · arXiv:2608.10480

Multi-Granular Rationale-Guided Molecular LLM for Property Prediction

incremental learningcontinual learningpublished Aug 12, 2026 · arXiv:2608.10464

Quantum Incremental Learning with Mixed State Prototypes

FAIR dataAI agentspublished Aug 12, 2026 · arXiv:2608.10363

Nutrition Data Infrastructure for the AI Era: Operationalizing FAIR for Agent-Mediated Research

large language modelstraining data granularitypublished Aug 12, 2026 · arXiv:2608.10214

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

Green AIGreen deep learningpublished Aug 12, 2026 · arXiv:2608.09998

Towards Sustainable Artificial Intelligence: A Comprehensive Review and Comparative Analysis of Deep Learning Models' Carbon Footprint

large language modelsdigital agriculturepublished Aug 12, 2026 · arXiv:2608.09949

Closed-Loop LLM Co-Pilots for Digital Agriculture

AI research agentsscholarly evolutionpublished Aug 12, 2026 · arXiv:2608.10740

Tree-of-Ideas: Automated Research Ideation via Cross-Trajectory Reasoning over Scholarly Evolution

knowledge graphsentity resolutionpublished Aug 12, 2026 · arXiv:2608.10644

Curate Before You Connect: Identity and Ontology Tagging in a Production Knowledge Graph

large language modelsdynamic few-shot learningpublished Aug 12, 2026 · arXiv:2608.10483

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

EHR interoperabilityFHIRpublished Aug 12, 2026 · arXiv:2608.10300

Logit-Boundary Geometric Belief Interfaces and Sparse Sheaf-Enclave Protocols: A Self-Contained Substrate for Secure Network Electronic Health Record (EHR) Interoperability

large language modelsprogram discoverypublished Aug 11, 2026 · arXiv:2608.08189

Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets

model provenancetraining-data overlappublished Aug 11, 2026 · arXiv:2608.08139

TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance

foundation ontologiessemantic mappingspublished Aug 11, 2026 · arXiv:2608.08122

Constraining ontology mappings using metaphysical choices

large language modelsneurosymbolic reasoningpublished Aug 11, 2026 · arXiv:2608.08118

Neurosymbolic Discovery of Algebraic Graph Constructions

interval predictionconformal regressionpublished Aug 11, 2026 · arXiv:2608.08078

PATH: Next-Interval Prediction via Autoregressive Tree Hierarchy on Tabular Data

medical datadata lakespublished Aug 11, 2026 · arXiv:2608.08056

H2: A Dual Hybrid Semantic Data Lake Architecture for Medical Data Harmonization with Human-in-the-Loop verified, LLM Driven Metadata Annotation System

radiologychest X-ray generationpublished Aug 11, 2026 · arXiv:2608.08046

JustLLMGRPO: Radiographic Control for Chest X-Ray Generation

social authorityLLM evaluationpublished Aug 11, 2026 · arXiv:2608.08026

The Authority Expectancy Effect in Multi-User Conflict

LinkedGrok 4.6GPT-5.6 LunaGemini 3.7 Flashclaude-fable-5, claude-sonnet-5, claude-opus-5
neuro-symbolic executiondistributed AI systemspublished Aug 11, 2026 · arXiv:2608.07947

Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI Programs

document understandingvision-language modelspublished Aug 11, 2026 · arXiv:2608.07943

Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

reasoning hallucinationknowledge hallucinationpublished Aug 11, 2026 · arXiv:2608.07931

REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

mixed-data clusteringlarge language modelspublished Aug 11, 2026 · arXiv:2608.07881

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

LLM judgesreasoning pipelinespublished Aug 11, 2026 · arXiv:2608.07813

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

LinkedDeepSeek-V4-Flash-0731
causal world modelsphysical AIpublished Aug 11, 2026 · arXiv:2608.07809

CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift

model provenanceweight-space analysispublished Aug 11, 2026 · arXiv:2608.07786

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

resource allocationcapacity managementpublished Aug 11, 2026 · arXiv:2608.07747

Adaptive Two-Level Allocation of a Conserved Capacity Budget Across Locations and Service Classes

large language modelsmolecular dynamicspublished Aug 11, 2026 · arXiv:2608.07637

Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC--MD Campaigns

continuous metric fieldscausal contrastive learningpublished Aug 11, 2026 · arXiv:2608.07566

The Field Knows: Cross-Dimensional Geometry from Navigation to Black Holes

AI scientistsautonomous researchpublished Aug 11, 2026 · arXiv:2608.07542

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

theorem recognitionformal mathematical knowledgepublished Aug 11, 2026 · arXiv:2608.07540

TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations

language model interpretabilityconfidence calibrationpublished Aug 11, 2026 · arXiv:2608.07528

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

structure theoriescanonicalizationpublished Aug 11, 2026 · arXiv:2608.07476

Determinization in Structure Theories: A Unified Framework via Closure, Comparability, and Joint Admissibility

human oversightAI output governancepublished Aug 11, 2026 · arXiv:2608.07474

Flow-by-Flow: Content-Judgment Bypass for Governing AI Output in High-Loss Domains

evaluative AIhuman-centred AIpublished Aug 11, 2026 · arXiv:2608.07473

Towards an Argumentative Foundation for Evaluative AI

Transformer forecastingchaotically gated activationspublished Aug 10, 2026 · arXiv:2608.07363

QFCQT: A Chaotically Gated Quantformer Framework for Volatile Time-Series Forecasting

AutoML benchmarkingtest-set selection biaspublished Aug 10, 2026 · arXiv:2608.07303

Winning by Peeking: Unenforced Budgets and Test-Set Selection Inflate Short-Budget AutoML Comparisons

STEM educationCurriculum as Codepublished Aug 10, 2026 · arXiv:2608.07364

Curriculum as Code: An AI-Assisted Architecture for Instructional Design in STEM Education

large language modelsrandomised controlled trialspublished Aug 10, 2026 · arXiv:2608.07202

Authoring and Management of Transparent Research Integrity Assessments of Randomised Clinical Trial Publications Using LLM-assisted Tools and Provenance Knowledge Graphs

PDE foundation modelsunsupervised fine-tuningpublished Aug 10, 2026 · arXiv:2608.07053

Unsupervised Adaptation of PDE Foundation Models

federated learningwireless networkspublished Aug 10, 2026 · arXiv:2608.07007

FedLBW: A Loss-Based Weighting Strategy for Federated Learning on Non-IID Data in Wireless Networks

biologically plausible learningDale's constraintpublished Aug 10, 2026 · arXiv:2608.06963

Learning in Deep Networks under Dale's Constraint

LLM preferencescultural biaspublished Aug 10, 2026 · arXiv:2608.06955

Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

multi-agent systemshuman-AI collaborationpublished Aug 10, 2026 · arXiv:2608.06926

TRIBE: Predicting Team Performance via Communication Behavior Ensembles

differentiable top-ksparse routingpublished Aug 10, 2026 · arXiv:2608.06912

Fast LapSum: Exact Differentiable Top-k at Million Scale

neural operatorsspectral operatorspublished Aug 10, 2026 · arXiv:2608.06894

From Points to Edges: Edge-Conditioned Spectral Operators for Physics-Sensitive PDE Learning

neuro-symbolic reasoningtemporal rule inductionpublished Aug 10, 2026 · arXiv:2608.06765

LiFTER: A Grounded Neuro-Symbolic Microscope for Continuous-Time Dynamic Graph Forecasting

text-to-video generationfake news detectionpublished Aug 10, 2026 · arXiv:2608.06732

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

biomedical knowledge graphsdrug discoverypublished Aug 10, 2026 · arXiv:2608.06713

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

agentic recommendationconversational recommendationpublished Aug 10, 2026 · arXiv:2608.06632

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

e-valuesconformal inferencepublished Aug 10, 2026 · arXiv:2608.06621

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

steerabilityreasoning disclosurepublished Aug 10, 2026 · arXiv:2608.06578

Divergent Response Modes in Frontier Language Models Under Steering Pressure

Linkedclaude-fable-5, claude-sonnet-5, claude-opus-5GPT-5.6
world modelsvisual controlpublished Aug 10, 2026 · arXiv:2608.06544

TaskSense: Focusing on What Matters in World Models

graph foundation modelsmulti-label node classificationpublished Aug 10, 2026 · arXiv:2608.06394

Towards Multi-Label Graph Foundation Models: from Single-Vector Representation Learning to Multi-Semantic Basis Learning

multi-agent systemslarge language modelspublished Aug 10, 2026 · arXiv:2608.06694

A Multi-Agent Framework for Automated Coarse-Grained Molecular Dynamics of Polymers

AI in policingracial biaspublished Aug 7, 2026 · arXiv:2608.05418

Negotiating Risk Boundaries in AI for Policing Through Mixed-Stakeholder Deliberation

Bayesian modellingepistemic uncertaintypublished Aug 7, 2026 · arXiv:2608.05642

Bayesian Expected Uncertainty Reduction (B-EUR) Model: A Computational Account of What Makes Design Options Worth Trying

time-aware sequential modelingmove history conditioningpublished Aug 7, 2026 · arXiv:2608.05206

Otter: A Time-Aware, History-Conditioned Human Chess AI

LinkedOtter
machine-condition monitoringanomaly detectionpublished Aug 7, 2026 · arXiv:2608.05685

Grounded Well-Condition Anomaly Detection on the Volve Field: Constructed Labels, a Baseline, and a Dual-Head Model

in-context learningcontext steeringpublished Aug 7, 2026 · arXiv:2608.05813

Cautious Context Steering for Language Model Personalization

natural language processingcourse similaritypublished Aug 7, 2026 · arXiv:2608.05910

CourseGraph: Finding overlaps and differences in Computer Science courses across universities

counterfactual analysiscausal reasoningpublished Aug 7, 2026 · arXiv:2608.05367

Counterfactual Analysis via Large Language Models

LinkedGPT-5.6
deep research agentsuser intent elicitationpublished Aug 7, 2026 · arXiv:2608.05876

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

human-centered machine learningstrategic behaviourpublished Aug 7, 2026 · arXiv:2608.05710

Shaping Human-AI Interactions to Provide Improvement Pathways and Balance Competing Objectives

agentic AIgene regulatory networkspublished Aug 7, 2026 · arXiv:2608.05359

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

parametric CAD code generationstate-aware agentspublished Aug 7, 2026 · arXiv:2608.05714

RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation

programming educationblock-based programmingpublished Aug 7, 2026 · arXiv:2608.05716

BlockPython: A Process-Aware Agent-Supported Platform for the Transition from Block-Based to Python Programming

agent-based economic simulationLLM-based agentspublished Aug 7, 2026 · arXiv:2608.06020

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

beamformingMIMO communicationspublished Aug 7, 2026 · arXiv:2608.05896

GSBF: Gaussian Splatting for Environment-Aware Beamforming

social interaction modellingmotion planningpublished Aug 7, 2026 · arXiv:2608.05673

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition

Show more