Unlock filters, categories &
Artificial Intelligence Paper Rankings
239 of 4821 papers
#
Paper
Score
Match
Win%
Published
1
Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI
Jiaqi Shao, Hanck Chen +3
1573
24
87.5%
Jul 24, 2026
3
Stress-testing large language model agents in a robotic chemistry laboratory
Lulu Guo, Yingkai Sun +6
1557
26
92.3%
Jul 25, 2026
4
Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
Hiskias Dingetocs.CL
1556
19
84.2%
Jul 22, 2026
5
RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning
Xi Chen, Hongru Zhou +6
1554
18
83.3%
Jul 25, 2026
6
1544
26
76.9%
Jul 23, 2026
7
1542
22
81.8%
Jul 24, 2026
8
AREX: Towards a Recursively Self-Improving Agent for Deep Research
Shuqi Lu, Chaofan Li +6v2
1532
20
75%
Jul 23, 2026
9
CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics
Xinhong Xu, Yimeng Zhang +1
1530
23
78.3%
Jul 25, 2026
10
1518
29
79.3%
Jul 27, 2026
11
Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning
Adhyyan Narang, Artin Tajdini +2
1517
20
70%
Jul 25, 2026
12
Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
Paul Simpson, John Kozak +1
1516
20
75%
Jul 25, 2026
13
MemTX: Transactional Belief Commit for Stateful Agent Memory
Xiaoyang Li, Yiqi Wang +5
1511
29
65.5%
Jul 27, 2026
14
Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model
Markus J. Buehlercs.CL
1507
20
75%
Jul 22, 2026
15
JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
Yuan Xiong, Linji Hao +3cs.CL
1506
19
78.9%
Jul 22, 2026
18
Let AI Agents Translate Networks, Not Reason About Them
Hongyu Hè, Maria Apostolakics.MAcs.NIcs.SC
1500
23
73.9%
Jul 24, 2026
19
Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
Zefeng Cai, Zerui Cai
1499
21
71.4%
Jul 26, 2026
20
Naju: A Native Discrete State-Space Model with Independent Retention and Writing for Long-Sequence Memory
Hyuk Lim, Seunghyun Yoon
1499
27
81.5%
Jul 23, 2026
21
Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
Heyang Jiang, Henry Liu +1
1499
26
65.4%
Jul 24, 2026
22
OpenForgeRL: Train Harness-native Agents in Any Environment
Xiao Yu, Baolin Peng +6v2cs.CL
1498
24
70.8%
Jul 23, 2026
23
Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning
Guanqun Zhao, Zijun Xie +6
1497
28
60.7%
Jul 24, 2026
24
SymStep: Symbolic Step Verification for Logical Reasoning
Aida Usmanova, Rui Gao +3
1494
19
63.2%
Jul 25, 2026
25
Are You Still the Agent I Authorized? Earned Authority under a Fixed Ceiling for Evolving Agents
Zhaoxi Zhang, Xiaomei Zhang
1486
20
70%
Jul 26, 2026
26
The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents
Darshan Tank, Baran Nama
1480
26
76.9%
Jul 24, 2026
27
ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control
Yan Zhang, Shibo Lics.CL
1478
21
76.2%
Jul 25, 2026
28
SoftReason: A Fully Differentiable Neuro-Soft-Symbolic Deductive Reasoning Architecture over High-Dimensional Perceptual Data
Wael AbdAlmageed
1478
20
80%
Jul 22, 2026
29
Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning
Wenxuan Zhang, Yuhui Wang +6
1476
23
65.2%
Jul 26, 2026
30
Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents
Valentin Tablan, Scott Taylor +1
1474
19
57.9%
Jul 24, 2026
32
V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure
Zhetong Zhang, Honghao Fu +3
1469
23
69.6%
Jul 23, 2026
33
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
Alexis Fox, Junlin Wang +2
1469
23
73.9%
Jul 22, 2026
34
Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
Saurabh Ranjan, Konstantina Sokratous +1cs.CLcs.CY
1467
14
64.3%
Jul 27, 2026
35
EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
Xinbang Dai, Zheyu Xin +6
1466
19
68.4%
Jul 22, 2026
36
GuardianAgentBench: Where Agents Fail and How to Guard Them
Vishal Ishwar Naik, Chenyu Xu +6
1465
19
63.2%
Jul 23, 2026
37
ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders
Zhongyuan Peng, Dan Huang +6
1461
24
75%
Jul 23, 2026
38
SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI
Mahdi Eslamimehr
1461
19
68.4%
Jul 24, 2026
39
MSBraM: A Multi-scale Self-supervised Brain Foundation Model for Hierarchical EEG Dynamics Learning
Tao Zhou, Jing Han +2
1460
27
70.4%
Jul 23, 2026
40
SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
Yang Wan, Zhenhao Zhang +2
1459
22
59.1%
Jul 25, 2026
41
From Execution to Capability: Scientific Experience Consolidation via Procedural Knowledge Synthesis
Liwei Dong, Jiahao Zhao +1
1458
14
71.4%
Jul 27, 2026
42
AgentOmnia: Scaling Agentic Models for Full-Scenario Applications
Hao Jiang, Gangtao Xin +6cs.CL
1455
23
65.2%
Jul 25, 2026
43
Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming
Zirong Chen, Meiyi Macs.LOcs.SC
1454
25
60%
Jul 25, 2026
44
Agentic Root Cause Analysis through Evidence-Grounded Reasoning
Amaury Wei, Olga Fink
1452
20
55%
Jul 24, 2026
45
Multimodal Pretraining for Generalizable EEG Representation Learning
Targol Bakhtiarvand, Jugal Kalita +1
1451
15
53.3%
Jul 23, 2026
46
MIRROR: Learning from the Other View for Multi-Modal Reasoning
Wen Ye, Yuxiao Qu +2
1449
21
61.9%
Jul 23, 2026
47
Failures Reveal What Metrics Miss: An Evidence-Driven Agent for Recursive Refinement of ECG Classifiers
Jinliang Deng, Yiming Niu +4
1449
18
66.7%
Jul 27, 2026
48
A Cyclic Adaptation-Generalization Framework with Uncertainty-Guided Self-Paced Learning for Long-Term Brain-Machine Interfaces
Jiyu Wei, Di Hong +4cs.HCeess.SP
1448
21
71.4%
Jul 27, 2026
49
CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion
Shreshth Saini, Neil Birkbeck +3cs.CVcs.MM
1446
19
57.9%
Jul 25, 2026
50
AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning
Qinfeng Li, Yuntai Bao +4
1442
20
65%
Jul 23, 2026
51
Agent-Guided Relational Concept Discovery: Toward Interpretable Surgical Margin Assessment
Nooshin Maghsoodi, Amoon Jamzad +6cs.AI
1440
22
54.5%
Jul 23, 2026
52
Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning
Baihui Wang, Bernard Kochcs.AI
1440
16
62.5%
Jul 23, 2026
53
QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization
Siwei Chen, Siqi Chen +2cs.AI
1440
26
53.8%
Jul 23, 2026
Sign up for free
Unlock search, filters, categories, archives, and .
