{"leaderboard":[{"id":"8eeb58f5-dc30-4501-91aa-d240e4bbe4e6","rank":1,"title":"Simulating clinical interventions with a generative multimodal model of human physiology","authors":["Guy Lutsker","Gal Sapir","Jordi Merino","Smadar Shilo","Anastasia Godneva","Eli Meirom","Shie Mannor","Hagai Rossman"],"arxiv_id":"2604.27899v1","link":"http://arxiv.org/abs/2604.27899v1","published":"2026-04-30T14:10:30Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1713,"ts_score":1713,"ts_sigma":1.5385230771866938,"ci":31.0,"wilson_margin":1.3,"win_rate":100.0,"wins":148,"losses":0,"comparisons":148,"ai_rating":7.8,"gap_score":1.4},{"id":"6fea71f3-270a-4bd6-ab97-8b0d228224af","rank":2,"title":"End-to-end autonomous scientific discovery on a real optical platform","authors":["Shuxing Yang","Fujia Chen","Rui Zhao","Junyao Wu","Yize Wang","Haiyao Luo","Ning Han","Qiaolu Chen"],"arxiv_id":"2604.27092v1","link":"http://arxiv.org/abs/2604.27092v1","published":"2026-04-29T18:36:57Z","primary_category":"cs.AI","categories":["cs.AI","physics.optics"],"score":1692,"ts_score":1692,"ts_sigma":1.3289355956625015,"ci":27.0,"wilson_margin":3.2,"win_rate":96.9,"wins":127,"losses":4,"comparisons":131,"ai_rating":7.0,"gap_score":11.7},{"id":"d31e174d-2e6d-4900-a3b0-daaeb4ee7aa8","rank":3,"title":"MIMIC: A Generative Multimodal Foundation Model for Biomolecules","authors":["Siavash Golkar","Jake Kovalic","Irina Espejo Morales","Samuel Sledzieski","Minhuan Li","Ksenia Sokolova","Geraud Krawezik","Alberto Bietti"],"arxiv_id":"2604.24506v1","link":"http://arxiv.org/abs/2604.24506v1","published":"2026-04-27T14:10:01Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1687,"ts_score":1687,"ts_sigma":1.2339272226022806,"ci":25.0,"wilson_margin":2.6,"win_rate":96.9,"wins":185,"losses":6,"comparisons":191,"ai_rating":8.0,"gap_score":0.5},{"id":"a7d5330f-7190-4a5b-96ca-88401b1ea52b","rank":4,"title":"Foundation Models to Unlock Real-World Evidence from Nationwide Medical Claims","authors":["Fan Ma","Yuntian Liu","Xiang Lan","Weipeng Zhou","Jun Ni","Mauro Giuffrè","Lingfei Qian","Xueqing Peng"],"arxiv_id":"2605.02740v1","link":"http://arxiv.org/abs/2605.02740v1","published":"2026-05-04T15:38:31Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1669,"ts_score":1669,"ts_sigma":1.1588045228803783,"ci":23.0,"wilson_margin":2.7,"win_rate":95.9,"wins":211,"losses":9,"comparisons":220,"ai_rating":7.8,"gap_score":1.4},{"id":"1902ebc3-556d-4a8d-a811-1a3e7e15c607","rank":5,"title":"Towards a General Intelligence and Interface for Wearable Health Data","authors":["Girish Narayanswamy","Maxwell A. Xu","A. Ali Heydari","Samy Abdel-Ghaffar","Marius Guerard","Kara Vaillancourt","Zhihan Zhang","Jake Garrison"],"arxiv_id":"2605.22759v1","link":"http://arxiv.org/abs/2605.22759v1","published":"2026-05-21T17:24:06Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1646,"ts_score":1646,"ts_sigma":1.43561120153041,"ci":29.0,"wilson_margin":9.4,"win_rate":84.2,"wins":48,"losses":9,"comparisons":57,"ai_rating":8.2,"gap_score":0.2},{"id":"d9b9122f-ca9f-445a-8585-e91fedfa4f29","rank":6,"title":"Machine Collective Intelligence for Explainable Scientific Discovery","authors":["Gyoung S. Na","Chanyoung Park"],"arxiv_id":"2604.27297v1","link":"http://arxiv.org/abs/2604.27297v1","published":"2026-04-30T01:15:54Z","primary_category":"cs.AI","categories":["cs.AI","physics.comp-ph"],"score":1644,"ts_score":1644,"ts_sigma":1.2010430785098838,"ci":24.0,"wilson_margin":6.7,"win_rate":86.3,"wins":88,"losses":14,"comparisons":102,"ai_rating":6.0,"gap_score":39.9},{"id":"e1405e86-8aaa-45ea-8556-3e1a394d70b2","rank":7,"title":"AI scientists produce results without reasoning scientifically","authors":["Martiño Ríos-García","Nawaf Alampara","Chandan Gupta","Indrajeet Mandal","Sajid Mannan","Ali Asghar Aghajani","N. M. Anoop Krishnan","Kevin Maik Jablonka"],"arxiv_id":"2604.18805v1","link":"http://arxiv.org/abs/2604.18805v1","published":"2026-04-20T20:23:42Z","primary_category":"cs.AI","categories":["cs.AI","cond-mat.mtrl-sci","cs.LG"],"score":1639,"ts_score":1639,"ts_sigma":1.0218783896107568,"ci":20.0,"wilson_margin":3.9,"win_rate":89.2,"wins":214,"losses":26,"comparisons":240,"ai_rating":8.5,"gap_score":-0.0},{"id":"a0bbed99-3710-4c24-bd0e-cd565aa59982","rank":8,"title":"Generative structure search for efficient and diverse discovery of molecular and crystal structures","authors":["Yifang Qin","Yu Shi","Junfu Tan","Chang Liu","Ming Zhang","Ziheng Lu"],"arxiv_id":"2604.27636v1","link":"http://arxiv.org/abs/2604.27636v1","published":"2026-04-30T09:26:05Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1626,"ts_score":1626,"ts_sigma":1.0747700942226635,"ci":21.0,"wilson_margin":8.2,"win_rate":76.8,"wins":76,"losses":23,"comparisons":99,"ai_rating":6.5,"gap_score":27.3},{"id":"bddb0b20-e915-4e40-bfea-22fc367db771","rank":9,"title":"IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures","authors":["David Gringras"],"arxiv_id":"2604.07709v1","link":"http://arxiv.org/abs/2604.07709v1","published":"2026-04-09T01:54:33Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.CY","cs.LG"],"score":1616,"ts_score":1616,"ts_sigma":0.9478403405272532,"ci":19.0,"wilson_margin":4.1,"win_rate":85.6,"wins":243,"losses":41,"comparisons":284,"ai_rating":7.8,"gap_score":1.3},{"id":"f2a12a86-1650-4a6d-a16d-81db3dc60d6a","rank":10,"title":"A Collective Variational Principle Unifying Bayesian Inference, Game Theory, and Thermodynamics","authors":["Djamel Bouchaffra","Faycal Ykhlef","Mustapha Lebbah","Hanane Azzag"],"arxiv_id":"2604.27942v1","link":"http://arxiv.org/abs/2604.27942v1","published":"2026-04-30T14:42:23Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1614,"ts_score":1614,"ts_sigma":1.1718070003055714,"ci":23.0,"wilson_margin":8.6,"win_rate":78.2,"wins":68,"losses":19,"comparisons":87,"ai_rating":3.5,"gap_score":93.3},{"id":"91a468d4-606a-4144-a89d-5dd5cd420156","rank":11,"title":"Containment Verification: AI Safety Guarantees Independent of Alignment","authors":["Royce Moon","Lav R. Varshney"],"arxiv_id":"2605.09045v1","link":"http://arxiv.org/abs/2605.09045v1","published":"2026-05-09T16:36:45Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR","cs.SE"],"score":1614,"ts_score":1614,"ts_sigma":1.6287727706882316,"ci":33.0,"wilson_margin":10.6,"win_rate":85.7,"wins":36,"losses":6,"comparisons":42,"ai_rating":6.5,"gap_score":27.2},{"id":"bb0d9bb8-faf3-4281-8d60-3022c19efaf8","rank":12,"title":"AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot","authors":["Joydeep Biswas","Sheila Schoepp","Gautham Vasan","Anthony Opipari","Arthur Zhang","Zichao Hu","Sebastian Joseph","Matthew Lease"],"arxiv_id":"2604.13940v1","link":"http://arxiv.org/abs/2604.13940v1","published":"2026-04-15T14:51:07Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1611,"ts_score":1611,"ts_sigma":0.9488043941227793,"ci":19.0,"wilson_margin":4.7,"win_rate":82.9,"wins":204,"losses":42,"comparisons":246,"ai_rating":7.8,"gap_score":1.2},{"id":"867bd42d-c210-4ff3-9bde-7b9be7c94e86","rank":13,"title":"Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet","authors":["Adly Templeton","Tom Conerly","Jonathan Marcus","Jack Lindsey","Trenton Bricken","Brian Chen","Adam Pearce","Craig Citro"],"arxiv_id":"2605.29358v1","link":"http://arxiv.org/abs/2605.29358v1","published":"2026-05-28T04:57:47Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1609,"ts_score":1609,"ts_sigma":1.8379668727418832,"ci":37.0,"wilson_margin":10.6,"win_rate":87.2,"wins":34,"losses":5,"comparisons":39,"ai_rating":9.0,"gap_score":-0.2},{"id":"b5c1a374-065d-4e07-831b-1425ebc802eb","rank":14,"title":"The Impossibility of Eliciting Latent Knowledge","authors":["Korbinian Friedl","Francis Rhys Ward","Paul Yushin Rapoport","Tom Everitt","Jonathan Richens"],"arxiv_id":"2606.12268v1","link":"http://arxiv.org/abs/2606.12268v1","published":"2026-06-10T16:11:13Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1607,"ts_score":1607,"ts_sigma":2.1309491197039594,"ci":43.0,"wilson_margin":13.5,"win_rate":80.6,"wins":25,"losses":6,"comparisons":31,"ai_rating":6.8,"gap_score":17.6},{"id":"3354e110-6acd-44d2-a4ba-45c5e54daf80","rank":15,"title":"A Signal-Language Foundation Model for Broad-Spectrum Cardiovascular Assessment from Routine Electrocardiography","authors":["Ziqing Yu","Yuhui Tao","Jiayu Huo","Lei Pan","Zilong Xiao","Juecheng Chen","Xiao Li","Jianxuan Li"],"arxiv_id":"2605.25446v1","link":"http://arxiv.org/abs/2605.25446v1","published":"2026-05-25T05:51:44Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1605,"ts_score":1605,"ts_sigma":1.76441332559497,"ci":35.0,"wilson_margin":9.8,"win_rate":87.0,"wins":40,"losses":6,"comparisons":46,"ai_rating":6.5,"gap_score":27.1},{"id":"d8fe4b13-37cb-4291-9744-ababd41b739b","rank":16,"title":"SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment","authors":["Joseph Breda","Fadi Yousif","Beszel Hawkins","Marinela Cotoi","Miao Liu","Ray Luo","Po-Hsuan Cameron Chen","Mike Schaekermann"],"arxiv_id":"2605.04012v1","link":"http://arxiv.org/abs/2605.04012v1","published":"2026-05-05T17:36:12Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1604,"ts_score":1604,"ts_sigma":1.522117968079387,"ci":30.0,"wilson_margin":12.6,"win_rate":71.7,"wins":33,"losses":13,"comparisons":46,"ai_rating":7.5,"gap_score":2.7},{"id":"5cfc26ee-ea35-4087-a738-e0c85411d21a","rank":17,"title":"Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment","authors":["Zhiqin Yang","Yonggang Zhang","Wei Xue","Dong Fang","Bo Han","Yike Guo"],"arxiv_id":"2605.20834v1","link":"http://arxiv.org/abs/2605.20834v1","published":"2026-05-20T07:26:22Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1604,"ts_score":1604,"ts_sigma":1.4468095764375009,"ci":29.0,"wilson_margin":12.5,"win_rate":68.0,"wins":34,"losses":16,"comparisons":50,"ai_rating":6.5,"gap_score":27.1},{"id":"c772a739-51bc-4e57-930c-6d938eec537c","rank":18,"title":"Hodoscope: Unsupervised Monitoring for AI Misbehaviors","authors":["Ziqian Zhong","Shashwat Saxena","Aditi Raghunathan"],"arxiv_id":"2604.11072v1","link":"http://arxiv.org/abs/2604.11072v1","published":"2026-04-13T06:52:05Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1597,"ts_score":1597,"ts_sigma":0.9617558178174518,"ci":19.0,"wilson_margin":5.2,"win_rate":80.7,"wins":176,"losses":42,"comparisons":218,"ai_rating":7.2,"gap_score":7.1},{"id":"13bb9e56-1f72-417c-a8d1-845cf3e710f3","rank":19,"title":"Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models","authors":["Inderjeet Nair","Jie Ruan","Lu Wang"],"arxiv_id":"2604.20995v2","link":"http://arxiv.org/abs/2604.20995v2","published":"2026-04-22T18:37:25Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.SE"],"score":1595,"ts_score":1595,"ts_sigma":1.4724955030140947,"ci":29.0,"wilson_margin":10.7,"win_rate":74.2,"wins":46,"losses":16,"comparisons":62,"ai_rating":7.0,"gap_score":11.3},{"id":"b8781f58-2096-45f8-aa71-40531b0c1171","rank":20,"title":"Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics","authors":["Moritz Firsching","Paul Lezeau","Salvatore Mercuri","Miklós Z. Horváth","Yaël Dillies","Calle Sönne","Eric Wieser","Fred Zhang"],"arxiv_id":"2605.13171v1","link":"http://arxiv.org/abs/2605.13171v1","published":"2026-05-13T08:33:15Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1594,"ts_score":1594,"ts_sigma":1.6114898887476368,"ci":32.0,"wilson_margin":13.5,"win_rate":73.7,"wins":28,"losses":10,"comparisons":38,"ai_rating":7.0,"gap_score":11.3},{"id":"96c79d6f-69a1-4bbe-8c82-5872d520c2eb","rank":21,"title":"KISS - Knowledge Infrastructure for Scientific Simulation: A Scaffolding for Agentic Earth Science","authors":["Ziwei Li","Liujun Zhu","Yuchen Liu","Yichen Zhao","Birk Li","Ruiqi Wu","Junliang Jin","Jianyun Zhang"],"arxiv_id":"2605.17856v1","link":"http://arxiv.org/abs/2605.17856v1","published":"2026-05-18T04:57:25Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1592,"ts_score":1592,"ts_sigma":1.8823256783704443,"ci":38.0,"wilson_margin":13.5,"win_rate":78.8,"wins":26,"losses":7,"comparisons":33,"ai_rating":7.8,"gap_score":1.0},{"id":"cbe9259a-0bff-420a-85bf-672d829459c1","rank":22,"title":"A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial","authors":["Haichao Chen","Songchi Zhou","Zhengyun Zhao","Shikai Hu","Xianghong Jin","Hongwei Ji","Li He","Shuli Li"],"arxiv_id":"2606.24510v1","link":"http://arxiv.org/abs/2606.24510v1","published":"2026-06-23T12:42:23Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1591,"ts_score":1591,"ts_sigma":2.1742960957157518,"ci":43.0,"wilson_margin":7.2,"win_rate":97.1,"wins":33,"losses":1,"comparisons":34,"ai_rating":8.0,"gap_score":0.0},{"id":"24c792de-ad1d-4fcf-985f-4bb662b93fea","rank":23,"title":"ENPIRE: Agentic Robot Policy Self-Improvement in the Real World","authors":["Wenli Xiao","Jia Xie","Tonghe Zhang","Haotian Lin","Letian \"Max\" Fu","Haoru Xue","Jalen Lu","Yi Yang"],"arxiv_id":"2606.19980v1","link":"http://arxiv.org/abs/2606.19980v1","published":"2026-06-18T09:21:27Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1591,"ts_score":1591,"ts_sigma":1.6633859504545052,"ci":33.0,"wilson_margin":13.7,"win_rate":75.0,"wins":27,"losses":9,"comparisons":36,"ai_rating":7.0,"gap_score":11.2},{"id":"0c820ba3-399e-462f-a5a3-6798b8e1b1c2","rank":24,"title":"When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning","authors":["Yotam Wolf","Noam Wies","Amnon Shashua"],"arxiv_id":"2607.06720v1","link":"http://arxiv.org/abs/2607.06720v1","published":"2026-07-07T18:36:04Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1591,"ts_score":1591,"ts_sigma":2.1834026640194475,"ci":44.0,"wilson_margin":11.0,"win_rate":92.3,"wins":24,"losses":2,"comparisons":26,"ai_rating":7.2,"gap_score":7.0},{"id":"63e3fb82-42f3-42f1-ae20-a1e09ba3c644","rank":25,"title":"A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols","authors":["Yankai Jiang","Weiting Tang","Haoran Sun","Zhenyu Tang","Yuejie Hou","Yingnan Han","Rubo Wang","Yueyuxiao Yang"],"arxiv_id":"2606.31763v1","link":"http://arxiv.org/abs/2606.31763v1","published":"2026-06-30T14:51:13Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1589,"ts_score":1589,"ts_sigma":2.2528540434583992,"ci":45.0,"wilson_margin":7.8,"win_rate":96.8,"wins":30,"losses":1,"comparisons":31,"ai_rating":7.5,"gap_score":2.5},{"id":"1dd3fc0f-e4f5-4fa1-9aa5-f2307a054f74","rank":26,"title":"Emotion Concepts and their Function in a Large Language Model","authors":["Nicholas Sofroniew","Isaac Kauvar","William Saunders","Runjin Chen","Tom Henighan","Sasha Hydrie","Craig Citro","Adam Pearce"],"arxiv_id":"2604.07729v1","link":"http://arxiv.org/abs/2604.07729v1","published":"2026-04-09T02:25:17Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1589,"ts_score":1589,"ts_sigma":0.9320599016928091,"ci":19.0,"wilson_margin":4.9,"win_rate":79.2,"wins":209,"losses":55,"comparisons":264,"ai_rating":8.2,"gap_score":-0.2},{"id":"610c7605-24a6-4a1f-a379-ab649bbe544d","rank":27,"title":"Heterogeneous Scientific Foundation Model Collaboration","authors":["Zihao Li","Jiaru Zou","Feihao Fang","Xuying Ning","Mengting Ai","Tianxin Wei","Sirui Chen","Xiyuan Yang"],"arxiv_id":"2604.27351v1","link":"https://arxiv.org/abs/2604.27351v1","published":"2026-04-30T03:02:27Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1587,"ts_score":1587,"ts_sigma":1.5325378830404628,"ci":31.0,"wilson_margin":13.5,"win_rate":65.9,"wins":29,"losses":15,"comparisons":44,"ai_rating":6.2,"gap_score":36.0},{"id":"dd12eb0a-01a2-434e-92d7-1962f8add679","rank":28,"title":"Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority","authors":["Xue Qin","Simin Luan","Cong Yang","Zhijun Li"],"arxiv_id":"2607.04613v1","link":"http://arxiv.org/abs/2607.04613v1","published":"2026-07-06T02:42:06Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR"],"score":1585,"ts_score":1585,"ts_sigma":2.1829567923480107,"ci":44.0,"wilson_margin":13.7,"win_rate":90.0,"wins":18,"losses":2,"comparisons":20,"ai_rating":5.8,"gap_score":46.0},{"id":"99e72b0b-1ed3-4b7d-aa15-df8ca74e8c3f","rank":29,"title":"Unbiased Prevalence Estimation with Multicalibrated LLMs","authors":["Fridolin Linder","Thomas Leeper","Daniel Haimovich","Niek Tax","Lorenzo Perini","Milan Vojnovic"],"arxiv_id":"2604.21549v1","link":"http://arxiv.org/abs/2604.21549v1","published":"2026-04-23T11:23:34Z","primary_category":"cs.AI","categories":["cs.AI","stat.ME"],"score":1585,"ts_score":1585,"ts_sigma":1.4548210251686164,"ci":29.0,"wilson_margin":13.4,"win_rate":63.0,"wins":29,"losses":17,"comparisons":46,"ai_rating":7.2,"gap_score":6.8},{"id":"3171d2d7-c0aa-444f-8d71-af8eeacda78e","rank":30,"title":"Attention Limited Reward Learning","authors":["Wenqian Xing"],"arxiv_id":"2607.04590v1","link":"http://arxiv.org/abs/2607.04590v1","published":"2026-07-06T01:33:12Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1585,"ts_score":1585,"ts_sigma":1.7300426575751677,"ci":35.0,"wilson_margin":11.9,"win_rate":80.5,"wins":33,"losses":8,"comparisons":41,"ai_rating":7.8,"gap_score":0.8},{"id":"a0184084-51eb-4143-ad67-76d2a7f90fde","rank":31,"title":"HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?","authors":["Mohamed Elfeki","Tu Trinh","Kelvin Luu","Guangze Luo","Nathan Hunt","Ernesto Montoya","Nandan Marwaha","Yannis He"],"arxiv_id":"2604.09408v1","link":"http://arxiv.org/abs/2604.09408v1","published":"2026-04-10T15:21:44Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1581,"ts_score":1581,"ts_sigma":0.9358536589844454,"ci":19.0,"wilson_margin":5.3,"win_rate":78.0,"wins":184,"losses":52,"comparisons":236,"ai_rating":7.4,"gap_score":3.5},{"id":"821df22b-4868-414b-908a-c89d963f72b5","rank":32,"title":"Why LLMs Fail at Causal Discovery and How Interventional Agents Escape","authors":["Amartya Roy","Sonali Parbhoo"],"arxiv_id":"2605.27567v1","link":"http://arxiv.org/abs/2605.27567v1","published":"2026-05-26T18:37:03Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1581,"ts_score":1581,"ts_sigma":2.1321939832020775,"ci":43.0,"wilson_margin":11.4,"win_rate":89.7,"wins":26,"losses":3,"comparisons":29,"ai_rating":7.0,"gap_score":11.1},{"id":"2ad8ee9e-598d-455d-bc47-5243fd06417d","rank":33,"title":"Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure","authors":["Max Lamparth","Daniel Fein","Andreas Haupt","Marcel Hussing","Mykel J. Kochenderfer"],"arxiv_id":"2605.27996v1","link":"http://arxiv.org/abs/2605.27996v1","published":"2026-05-27T05:40:22Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1581,"ts_score":1581,"ts_sigma":2.1276032987329705,"ci":43.0,"wilson_margin":14.8,"win_rate":85.7,"wins":18,"losses":3,"comparisons":21,"ai_rating":7.8,"gap_score":0.8},{"id":"9242fdaa-daa8-4679-b1a5-4e5fcdcb389f","rank":34,"title":"Kairos: A Native World Model Stack for Physical AI","authors":[" Kairos Team","Fei Wang","Shan You","Qiming Zhang","Tao Huang","Zuoyi Fu","Zhisheng Zheng","Yunlong Xi"],"arxiv_id":"2606.16533v1","link":"http://arxiv.org/abs/2606.16533v1","published":"2026-06-15T10:37:42Z","primary_category":"cs.AI","categories":["cs.AI","cs.CV"],"score":1580,"ts_score":1580,"ts_sigma":1.5515127495616128,"ci":31.0,"wilson_margin":15.0,"win_rate":65.7,"wins":23,"losses":12,"comparisons":35,"ai_rating":7.0,"gap_score":11.0},{"id":"789d43b7-7dca-4a6d-bc29-ff9b33714a05","rank":35,"title":"BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature","authors":["Jiaxian Yan","Jintao Zhu","Yuhang Yang","Qi Liu","Kai Zhang","Zaixi Zhang","Xukai Liu","Boyan Zhang"],"arxiv_id":"2604.21508v1","link":"http://arxiv.org/abs/2604.21508v1","published":"2026-04-23T10:11:56Z","primary_category":"cs.AI","categories":["cs.AI","q-bio.BM"],"score":1580,"ts_score":1580,"ts_sigma":1.1608731515333262,"ci":23.0,"wilson_margin":9.9,"win_rate":69.1,"wins":56,"losses":25,"comparisons":81,"ai_rating":7.2,"gap_score":6.7},{"id":"19977cc2-889d-48be-be7b-d765ce4811b4","rank":36,"title":"GIF: Locally Sound Geometric Information Flow Control for LLMs","authors":["Adam Storek","Nikolaus Holzer","Zhuo Zhang","Suman Jana"],"arxiv_id":"2606.23277v1","link":"http://arxiv.org/abs/2606.23277v1","published":"2026-06-22T12:54:04Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1580,"ts_score":1580,"ts_sigma":2.143576783283567,"ci":43.0,"wilson_margin":17.4,"win_rate":82.4,"wins":14,"losses":3,"comparisons":17,"ai_rating":8.3,"gap_score":-0.6},{"id":"b488f02b-0aff-4c9a-9bce-9cf7a2088e97","rank":37,"title":"Brief chatbot interactions produce lasting changes in human moral values","authors":["Yue Teng","Qianer Zhong","Kim Mai Tich Nguyen Thordsen","Christian Montag","Benjamin Becker"],"arxiv_id":"2604.21430v1","link":"http://arxiv.org/abs/2604.21430v1","published":"2026-04-23T08:47:33Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1578,"ts_score":1578,"ts_sigma":1.3626781592167154,"ci":27.0,"wilson_margin":11.8,"win_rate":74.0,"wins":37,"losses":13,"comparisons":50,"ai_rating":6.2,"gap_score":35.8},{"id":"ec0cb6e5-123e-409b-830e-e500d22525c2","rank":38,"title":"Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis","authors":["Michael Cuccarese"],"arxiv_id":"2604.06013v1","link":"http://arxiv.org/abs/2604.06013v1","published":"2026-04-07T16:06:52Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1577,"ts_score":1577,"ts_sigma":0.9240372450503075,"ci":18.0,"wilson_margin":4.1,"win_rate":81.5,"wins":282,"losses":64,"comparisons":346,"ai_rating":5.8,"gap_score":45.7},{"id":"7b2bc739-8b54-41d7-a54f-a729f9fcdfde","rank":39,"title":"Polysemantic Experts, Monosemantic Paths: Routing as Control in MoEs","authors":["Charles Ye","Bo Yuan","Lee Sharkey"],"arxiv_id":"2604.17837v1","link":"http://arxiv.org/abs/2604.17837v1","published":"2026-04-20T05:47:26Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1577,"ts_score":1577,"ts_sigma":1.226811181684487,"ci":25.0,"wilson_margin":8.7,"win_rate":75.8,"wins":69,"losses":22,"comparisons":91,"ai_rating":7.8,"gap_score":0.6},{"id":"4c1407d3-80bf-4431-b94f-6c88a7631f25","rank":40,"title":"Interaction Scaling: Grounding the Third Axis of Test-Time Compute","authors":["Bojie Li","Noah Shi"],"arxiv_id":"2607.11598v1","link":"http://arxiv.org/abs/2607.11598v1","published":"2026-07-13T14:22:06Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1577,"ts_score":1577,"ts_sigma":2.1817889825757093,"ci":44.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":6.8,"gap_score":17.0},{"id":"720640dd-97bc-41e3-8d10-8300ba987e87","rank":41,"title":"Bounding the Black Box: A Statistical Certification Framework for AI Risk Regulation","authors":["Natan Levy","Gadi Perl"],"arxiv_id":"2604.21854v1","link":"http://arxiv.org/abs/2604.21854v1","published":"2026-04-23T16:50:35Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1576,"ts_score":1576,"ts_sigma":1.5634214317484663,"ci":31.0,"wilson_margin":12.1,"win_rate":77.3,"wins":34,"losses":10,"comparisons":44,"ai_rating":4.5,"gap_score":77.6},{"id":"2554148b-c676-4425-8279-4c1c0bfd0ddd","rank":42,"title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","authors":["Zixuan Wang","Xingyu Dang","Jason D. Lee","Kaifeng Lyu"],"arxiv_id":"2604.22951v1","link":"http://arxiv.org/abs/2604.22951v1","published":"2026-04-24T18:49:08Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1576,"ts_score":1576,"ts_sigma":1.676898260465358,"ci":34.0,"wilson_margin":13.9,"win_rate":67.5,"wins":27,"losses":13,"comparisons":40,"ai_rating":7.2,"gap_score":6.5},{"id":"1b77b763-28c8-4449-a63a-7375106e5691","rank":43,"title":"Towards Understanding Specification Gaming in Reasoning Models","authors":["Kei Nishimura-Gasparian","Robert McCarthy","David Lindner"],"arxiv_id":"2605.02269v1","link":"http://arxiv.org/abs/2605.02269v1","published":"2026-05-04T06:22:22Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1576,"ts_score":1576,"ts_sigma":1.3219748519423418,"ci":26.0,"wilson_margin":8.9,"win_rate":75.9,"wins":66,"losses":21,"comparisons":87,"ai_rating":6.8,"gap_score":17.0},{"id":"ff03205b-d8fc-4d9d-82ec-738204f57a86","rank":44,"title":"Auditable Agents","authors":["Yi Nian","Aojie Yuan","Haiyue Zhang","Jiate Li","Yue Zhao"],"arxiv_id":"2604.05485v1","link":"http://arxiv.org/abs/2604.05485v1","published":"2026-04-07T06:25:49Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1575,"ts_score":1575,"ts_sigma":0.9853982810039503,"ci":20.0,"wilson_margin":6.7,"win_rate":76.5,"wins":117,"losses":36,"comparisons":153,"ai_rating":6.8,"gap_score":16.9},{"id":"9785bcd8-05ba-40da-9c15-b9f6c3ea492b","rank":45,"title":"AgentPLM: Agentic Protein Language Models with Reasoning-Augmented Decoding for Protein Sequence Design","authors":["Sahil Rahman","Maxx Richard Rahman"],"arxiv_id":"2606.02386v1","link":"http://arxiv.org/abs/2606.02386v1","published":"2026-06-01T15:35:02Z","primary_category":"cs.AI","categories":["cs.AI","q-bio.QM"],"score":1575,"ts_score":1575,"ts_sigma":1.953463340956217,"ci":39.0,"wilson_margin":14.3,"win_rate":73.5,"wins":25,"losses":9,"comparisons":34,"ai_rating":5.5,"gap_score":56.4},{"id":"05a4235d-4370-4687-b3fe-cf75657a9cc9","rank":46,"title":"Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation","authors":["Jacob Dang","Brian Y. Xie","Omar G. Younis"],"arxiv_id":"2604.15559v1","link":"http://arxiv.org/abs/2604.15559v1","published":"2026-04-16T22:23:01Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1575,"ts_score":1575,"ts_sigma":1.3391821266867798,"ci":27.0,"wilson_margin":11.9,"win_rate":67.9,"wins":38,"losses":18,"comparisons":56,"ai_rating":5.5,"gap_score":56.4},{"id":"ec7d3530-4276-4541-af2c-4dab8bcb46bf","rank":47,"title":"The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations","authors":["Rania Elbadry","Ahmed Heakl","Fan Zhang","Dani Bouch","Yuxia Wang","Preslav Nakov","Zhuohan Xie"],"arxiv_id":"2605.09195v1","link":"http://arxiv.org/abs/2605.09195v1","published":"2026-05-09T22:27:31Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1574,"ts_score":1574,"ts_sigma":2.147463492078746,"ci":43.0,"wilson_margin":10.9,"win_rate":95.2,"wins":20,"losses":1,"comparisons":21,"ai_rating":7.8,"gap_score":0.4},{"id":"d62c2a20-d223-433e-8f16-f6aa44d47df0","rank":48,"title":"Socratic agents for autonomous scientific discovery in high-dimensional physical systems","authors":["Xianrui Zeng","Pengfei Liu","Yirui Zang","Yang Shen","Fei Yu","Chunlei Yu","Minghao Liu","Yang Du"],"arxiv_id":"2606.26722v1","link":"http://arxiv.org/abs/2606.26722v1","published":"2026-06-25T08:01:07Z","primary_category":"cs.AI","categories":["cs.AI","physics.optics"],"score":1573,"ts_score":1573,"ts_sigma":2.016462769551942,"ci":40.0,"wilson_margin":11.7,"win_rate":81.0,"wins":34,"losses":8,"comparisons":42,"ai_rating":5.5,"gap_score":56.3},{"id":"d3887a26-4794-47e3-8943-f0e1cb8f5c7d","rank":49,"title":"Evidence-Grounded AI for Musculoskeletal Care","authors":["Wenjie Li","Yujie Zhang","Fanrui Zhang","Haoran Sun","Renhao Yang","Junjun He","Weiran Huang","Yuanfeng Ji"],"arxiv_id":"2607.12527v1","link":"http://arxiv.org/abs/2607.12527v1","published":"2026-07-14T09:03:26Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1573,"ts_score":1573,"ts_sigma":2.1459811180613655,"ci":43.0,"wilson_margin":16.0,"win_rate":84.2,"wins":16,"losses":3,"comparisons":19,"ai_rating":7.5,"gap_score":2.0},{"id":"374e17ab-2532-4fd0-bf1a-9ab810c243a2","rank":50,"title":"ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence","authors":["Rui Meng","Bhavana Dalvi Mishra","Jiefeng Chen","Chun-Liang Li","Palash Goyal","Mihir Parmar","Yiwen Song","Yale Song"],"arxiv_id":"2605.26340v1","link":"http://arxiv.org/abs/2605.26340v1","published":"2026-05-25T21:30:27Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.MA"],"score":1573,"ts_score":1573,"ts_sigma":1.9927449656833205,"ci":40.0,"wilson_margin":14.8,"win_rate":74.2,"wins":23,"losses":8,"comparisons":31,"ai_rating":7.2,"gap_score":6.4},{"id":"2799e321-8b50-4db0-88be-631c0472363f","rank":51,"title":"Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI","authors":["Jiaqi Shao","Hanck Chen","Wei Zhang","Maxm Pan","Bing Luo"],"arxiv_id":"2607.22368v1","link":"http://arxiv.org/abs/2607.22368v1","published":"2026-07-24T14:55:19Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1573,"ts_score":1573,"ts_sigma":2.2437103161569762,"ci":45.0,"wilson_margin":13.3,"win_rate":87.5,"wins":21,"losses":3,"comparisons":24,"ai_rating":6.5,"gap_score":26.4},{"id":"ed79cc47-e3c1-4720-8d17-b16460ab5de4","rank":52,"title":"Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search","authors":["Sarah Martinson","Michael P. Brenner","Martyna Plomecka","Brian P. Williams","Nicholas G. Reich","Zahra Shamsi"],"arxiv_id":"2605.16238v1","link":"http://arxiv.org/abs/2605.16238v1","published":"2026-05-15T17:45:17Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1572,"ts_score":1572,"ts_sigma":2.131362738167193,"ci":43.0,"wilson_margin":16.8,"win_rate":80.0,"wins":16,"losses":4,"comparisons":20,"ai_rating":8.2,"gap_score":-0.8},{"id":"de4abbe6-a7cc-406a-a9bb-2f1c159a24d5","rank":53,"title":"WorldKernel: A World Model is the Coupling Kernel of Admissible Possible Worlds","authors":["Fabio Rovai"],"arxiv_id":"2606.10934v1","link":"http://arxiv.org/abs/2606.10934v1","published":"2026-06-09T14:44:52Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1572,"ts_score":1572,"ts_sigma":2.1515013138555914,"ci":43.0,"wilson_margin":12.9,"win_rate":88.0,"wins":22,"losses":3,"comparisons":25,"ai_rating":5.8,"gap_score":45.4},{"id":"91a8208f-e5b7-464d-9910-606d782d9089","rank":54,"title":"Advancing Mathematics Research with AI-Driven Formal Proof Search","authors":["George Tsoukalas","Anton Kovsharov","Sergey Shirobokov","Anja Surina","Moritz Firsching","Gergely Bérczi","Francisco J. R. Ruiz","Arun Suggala"],"arxiv_id":"2605.22763v1","link":"http://arxiv.org/abs/2605.22763v1","published":"2026-05-21T17:24:57Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1572,"ts_score":1572,"ts_sigma":2.197315859881585,"ci":44.0,"wilson_margin":12.9,"win_rate":88.0,"wins":22,"losses":3,"comparisons":25,"ai_rating":9.0,"gap_score":-1.1},{"id":"4f5c0668-76bf-486d-bbb3-36a167ceb5a6","rank":55,"title":"Zero knowledge verification for frontier AI training is possible","authors":["Pierre Peigné","Ky Nguyen","Paul Wang"],"arxiv_id":"2606.05433v1","link":"https://arxiv.org/abs/2606.05433","published":"2026-06-03T20:57:28Z","primary_category":"cs.AI","categories":["cs.AI","cs.SY","eess.SY"],"score":1572,"ts_score":1572,"ts_sigma":2.186512951732597,"ci":44.0,"wilson_margin":10.0,"win_rate":93.1,"wins":27,"losses":2,"comparisons":29,"ai_rating":7.0,"gap_score":10.6},{"id":"cef5643e-d8c0-45be-b816-8cfbb10c195a","rank":56,"title":"Context Over Content: Exposing Evaluation Faking in Automated Judges","authors":["Manan Gupta","Inderjeet Nair","Lu Wang","Dhruv Kumar"],"arxiv_id":"2604.15224v1","link":"http://arxiv.org/abs/2604.15224v1","published":"2026-04-16T16:55:53Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1571,"ts_score":1571,"ts_sigma":1.4653130982721938,"ci":29.0,"wilson_margin":12.1,"win_rate":77.3,"wins":34,"losses":10,"comparisons":44,"ai_rating":5.5,"gap_score":56.1},{"id":"9d8d09f0-bee9-40e6-af2b-9ed51ae86181","rank":57,"title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","authors":["Meng Chu","Xuan Billy Zhang","Kevin Qinghong Lin","Lingdong Kong","Jize Zhang","Teng Tu","Weijian Ma","Ziqi Huang"],"arxiv_id":"2604.22748v1","link":"http://arxiv.org/abs/2604.22748v1","published":"2026-04-24T17:48:47Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1571,"ts_score":1571,"ts_sigma":1.6675530610588019,"ci":33.0,"wilson_margin":13.1,"win_rate":76.3,"wins":29,"losses":9,"comparisons":38,"ai_rating":7.2,"gap_score":6.2},{"id":"5433d61e-78ef-4594-9690-64ed38b7f132","rank":58,"title":"Using large language models for embodied planning introduces systematic safety risks","authors":["Tao Zhang","Kaixian Qu","Zhibin Li","Jiajun Wu","Marco Hutter","Manling Li","Fan Shi"],"arxiv_id":"2604.18463v2","link":"http://arxiv.org/abs/2604.18463v2","published":"2026-04-20T16:18:08Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","cs.RO"],"score":1571,"ts_score":1571,"ts_sigma":1.7226862148353053,"ci":34.0,"wilson_margin":13.0,"win_rate":70.5,"wins":31,"losses":13,"comparisons":44,"ai_rating":7.8,"gap_score":0.2,"current_version":2},{"id":"45b40e6e-6e40-464d-a2a2-8987802b92b0","rank":59,"title":"Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe","authors":["Qian Zhao","Kunlong Chen","Changxin Tian","Zhonghui Jiang","Haitao Zhang","Chaofan Yu","Peijie Jiang","Mingliang Gong"],"arxiv_id":"2606.20381v1","link":"http://arxiv.org/abs/2606.20381v1","published":"2026-06-18T15:40:51Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1571,"ts_score":1571,"ts_sigma":2.1633875419856965,"ci":43.0,"wilson_margin":15.6,"win_rate":81.8,"wins":18,"losses":4,"comparisons":22,"ai_rating":7.3,"gap_score":3.6},{"id":"33cc844f-5738-4fd1-8aca-d8721f19cb4d","rank":60,"title":"Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models","authors":["Chashi Mahiul Islam","Alan Villarreal","Mao Nishino","Shaeke Salman","Xiuwen Liu"],"arxiv_id":"2604.13206v1","link":"http://arxiv.org/abs/2604.13206v1","published":"2026-04-14T18:26:38Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","math.NA"],"score":1571,"ts_score":1571,"ts_sigma":1.2326752893190336,"ci":25.0,"wilson_margin":9.1,"win_rate":75.9,"wins":63,"losses":20,"comparisons":83,"ai_rating":5.2,"gap_score":63.0},{"id":"0e74007b-5dfa-4a75-a005-464995b9ea79","rank":61,"title":"MiniMax Sparse Attention","authors":["Xunhao Lai","Weiqi Xu","Yufeng Yang","Qiaorui Chen","Yang Xu","Lunbin Zeng","Xiaolong Li","Haohai Sun"],"arxiv_id":"2606.13392v2","link":"http://arxiv.org/abs/2606.13392v2","published":"2026-06-11T14:23:41Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1571,"ts_score":1571,"ts_sigma":2.1989727460624384,"ci":44.0,"wilson_margin":14.3,"win_rate":86.4,"wins":19,"losses":3,"comparisons":22,"ai_rating":7.8,"gap_score":0.2,"current_version":2},{"id":"973022d6-4543-46e9-a397-1df85457b9ee","rank":62,"title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","authors":["Daniel Russo"],"arxiv_id":"2601.18175v2","link":"https://arxiv.org/abs/2601.18175","published":"2026-01-26T05:54:39Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","cs.SY","eess.SY","stat.ML"],"score":1570,"ts_score":1570,"ts_sigma":2.127759623245202,"ci":43.0,"wilson_margin":15.4,"win_rate":85.0,"wins":17,"losses":3,"comparisons":20,"ai_rating":7.8,"gap_score":0.1},{"id":"7b3debc6-6e76-442c-a61d-76e02268f805","rank":63,"title":"What AI Red-Team Evaluations Can and Cannot Prove","authors":["Bandana Kaur"],"arxiv_id":"2607.21735v1","link":"http://arxiv.org/abs/2607.21735v1","published":"2026-07-23T18:34:12Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR"],"score":1570,"ts_score":1570,"ts_sigma":2.170748053000854,"ci":43.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":6.5,"gap_score":26.1},{"id":"ff100547-d01d-4514-b539-de3d35d6b1a8","rank":64,"title":"Next-Token Prediction Learns Generalisable Representations of Sleep Physiology","authors":["Jonathan F. Carter","Lionel Tarassenko"],"arxiv_id":"2606.09605v1","link":"http://arxiv.org/abs/2606.09605v1","published":"2026-06-08T15:13:57Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1569,"ts_score":1569,"ts_sigma":2.143217872070584,"ci":43.0,"wilson_margin":17.4,"win_rate":82.4,"wins":14,"losses":3,"comparisons":17,"ai_rating":8.2,"gap_score":-1.1},{"id":"4f2dcd94-974d-4f39-b86c-1156c351c482","rank":65,"title":"Discovering Novel LLM Experts via Task-Capability Coevolution","authors":["Andrew Dai","Boris Meinardus","Ciaran Regan","Yingtao Tian","Yujin Tang"],"arxiv_id":"2604.14969v1","link":"http://arxiv.org/abs/2604.14969v1","published":"2026-04-16T13:06:11Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1569,"ts_score":1569,"ts_sigma":1.404645710139062,"ci":28.0,"wilson_margin":11.6,"win_rate":72.2,"wins":39,"losses":15,"comparisons":54,"ai_rating":6.8,"gap_score":16.5},{"id":"eb0f7e02-3735-4481-bd72-15e085048a3f","rank":66,"title":"S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation","authors":["Jiahao Zhao","Junyi Liu","Lifeng Xu","Nan Xu","Qingli Wang","Qingxiao Li","Tianle Chen","Xiaoyu Wu"],"arxiv_id":"2607.15686v1","link":"http://arxiv.org/abs/2607.15686v1","published":"2026-07-17T06:56:08Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1568,"ts_score":1568,"ts_sigma":2.154556194602266,"ci":43.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":5.5,"gap_score":55.9},{"id":"5c746626-e2de-453b-8338-0d4bc74c0ffb","rank":67,"title":"ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity","authors":["Andrew Bo Liu","Samira Nedungadi","Bryce Cai","Alex Kleinman","Harmon Bhasin","Seth Donoughe"],"arxiv_id":"2606.11150v1","link":"http://arxiv.org/abs/2606.11150v1","published":"2026-06-09T17:35:37Z","primary_category":"cs.AI","categories":["cs.AI","cs.CY"],"score":1568,"ts_score":1568,"ts_sigma":2.1218591754762643,"ci":42.0,"wilson_margin":15.4,"win_rate":85.0,"wins":17,"losses":3,"comparisons":20,"ai_rating":7.0,"gap_score":10.3},{"id":"0cc41781-5f56-4756-8f15-871fa52b7197","rank":68,"title":"AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation","authors":["Shanghua Gao","Ada Fang","Marinka Zitnik"],"arxiv_id":"2605.28655v1","link":"http://arxiv.org/abs/2605.28655v1","published":"2026-05-27T15:56:12Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1568,"ts_score":1568,"ts_sigma":2.125347866718006,"ci":43.0,"wilson_margin":12.5,"win_rate":86.2,"wins":25,"losses":4,"comparisons":29,"ai_rating":7.2,"gap_score":6.0},{"id":"eddef414-7cc4-480f-816a-293b0a447ec6","rank":69,"title":"LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks","authors":["Po-Nien Kung","Linfeng Song","Dawsen Hwang","Jinsung Yoon","Chun-Liang Li","Simone Severini","Mirek Olšák","Edward Lockhart"],"arxiv_id":"2606.03303v1","link":"http://arxiv.org/abs/2606.03303v1","published":"2026-06-02T08:16:42Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1567,"ts_score":1567,"ts_sigma":2.199446502408396,"ci":44.0,"wilson_margin":11.7,"win_rate":89.3,"wins":25,"losses":3,"comparisons":28,"ai_rating":7.8,"gap_score":-0.0},{"id":"07f03fac-2889-48c5-9db2-b2095e9e4ea0","rank":70,"title":"The Accountability Horizon: An Impossibility Theorem for Governing Human-Agent Collectives","authors":["Haileleol Tibebu"],"arxiv_id":"2604.07778v1","link":"http://arxiv.org/abs/2604.07778v1","published":"2026-04-09T04:08:26Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1567,"ts_score":1567,"ts_sigma":1.117029642499353,"ci":22.0,"wilson_margin":8.8,"win_rate":75.6,"wins":68,"losses":22,"comparisons":90,"ai_rating":5.5,"gap_score":55.9},{"id":"d33a12b3-9e33-4ddf-8b9a-272cd84b5e17","rank":71,"title":"Causal Bias Detection in Generative Artifical Intelligence","authors":["Drago Plecko"],"arxiv_id":"2605.11365v1","link":"http://arxiv.org/abs/2605.11365v1","published":"2026-05-12T00:36:53Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","stat.ML"],"score":1566,"ts_score":1566,"ts_sigma":2.1825177312624384,"ci":44.0,"wilson_margin":11.4,"win_rate":92.0,"wins":23,"losses":2,"comparisons":25,"ai_rating":7.0,"gap_score":10.2},{"id":"75c60ee5-7f1e-4719-8d45-1a55c2646fa0","rank":72,"title":"Model Spec Midtraining: Improving How Alignment Training Generalizes","authors":["Chloe Li","Sara Price","Samuel Marks","Jon Kutasov"],"arxiv_id":"2605.02087v1","link":"http://arxiv.org/abs/2605.02087v1","published":"2026-05-03T23:16:14Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1566,"ts_score":1566,"ts_sigma":1.7330793270577185,"ci":35.0,"wilson_margin":7.5,"win_rate":89.4,"wins":59,"losses":7,"comparisons":66,"ai_rating":7.2,"gap_score":5.9},{"id":"3c30f8bb-4fc4-4c9e-93d7-32b19c116e6e","rank":73,"title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","authors":["Qiyao Liang","Risto Miikkulainen","Ila Fiete"],"arxiv_id":"2605.05686v1","link":"http://arxiv.org/abs/2605.05686v1","published":"2026-05-07T05:25:54Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1566,"ts_score":1566,"ts_sigma":2.1458844225971334,"ci":43.0,"wilson_margin":10.1,"win_rate":95.7,"wins":22,"losses":1,"comparisons":23,"ai_rating":7.8,"gap_score":-0.1},{"id":"ef7303a1-12b8-463c-890a-eeb8a938b073","rank":74,"title":"Measuring Reward-Seeking via Contrastive Belief Updates","authors":["Axel Højmark","Jérémy Scheurer","Evgenia Nitishinskaya","Felix Hofstätter","Jason Wolfe","Theodore Ehrenborg","Bronson Schoen","Alexander Meinke"],"arxiv_id":"2607.18966v1","link":"http://arxiv.org/abs/2607.18966v1","published":"2026-07-21T10:57:09Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1564,"ts_score":1564,"ts_sigma":2.1672123655846107,"ci":43.0,"wilson_margin":11.1,"win_rate":90.0,"wins":27,"losses":3,"comparisons":30,"ai_rating":7.8,"gap_score":-0.2},{"id":"cc51c7a1-9d34-4165-a2ee-1a9af7d2b5f4","rank":75,"title":"How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles","authors":["Chenchen Kuai","Jiwan Jiang","Zihao Zhu","Hao Wang","Keshu Wu","Zihao Li","Yunlong Zhang","Chenxi Liu"],"arxiv_id":"2604.07650v1","link":"http://arxiv.org/abs/2604.07650v1","published":"2026-04-08T23:32:06Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1564,"ts_score":1564,"ts_sigma":1.0921487762268838,"ci":22.0,"wilson_margin":8.0,"win_rate":75.2,"wins":82,"losses":27,"comparisons":109,"ai_rating":6.2,"gap_score":34.9},{"id":"9622d9c1-0f1d-41e4-9f1e-07e5ca649d3f","rank":76,"title":"Entropy Distribution as a Fingerprint for Hallucinations in Generative Models","authors":["Mattia J. Villani","Pranav Deshpande","Akshay Seshadri","Romina Yalovetzky","Niraj Kumar"],"arxiv_id":"2605.28264v1","link":"http://arxiv.org/abs/2605.28264v1","published":"2026-05-27T10:12:44Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1564,"ts_score":1564,"ts_sigma":2.1164799983895675,"ci":42.0,"wilson_margin":14.1,"win_rate":84.0,"wins":21,"losses":4,"comparisons":25,"ai_rating":6.8,"gap_score":16.2},{"id":"21997152-604a-4617-97c9-d7e25a59db56","rank":77,"title":"Towards Faster Language Model Inference Using Mixture-of-Experts Flow Matching","authors":["Aihua Li"],"arxiv_id":"2604.15009v1","link":"http://arxiv.org/abs/2604.15009v1","published":"2026-04-16T13:36:04Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1564,"ts_score":1564,"ts_sigma":1.3722842934565176,"ci":27.0,"wilson_margin":9.9,"win_rate":75.7,"wins":53,"losses":17,"comparisons":70,"ai_rating":6.2,"gap_score":34.9},{"id":"a322e275-87fe-43b6-8b0e-b15ade06822c","rank":78,"title":"Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases","authors":["Dongyoon Hahm","Dylan Hadfield-Menell","Kimin Lee"],"arxiv_id":"2605.27355v1","link":"http://arxiv.org/abs/2605.27355v1","published":"2026-05-26T17:57:04Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1563,"ts_score":1563,"ts_sigma":1.8709035511652454,"ci":37.0,"wilson_margin":13.3,"win_rate":74.4,"wins":29,"losses":10,"comparisons":39,"ai_rating":6.5,"gap_score":25.7},{"id":"a0bb9f25-1021-4ffd-91cc-979a82951bf5","rank":79,"title":"RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair","authors":["Jagadeesh Rachapudi","Pranav Singh","Ritali Vatsi","Praful Hambarde","Amit Shukla"],"arxiv_id":"2604.12820v1","link":"http://arxiv.org/abs/2604.12820v1","published":"2026-04-14T14:44:45Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1563,"ts_score":1563,"ts_sigma":1.3188360074632974,"ci":26.0,"wilson_margin":10.5,"win_rate":75.8,"wins":47,"losses":15,"comparisons":62,"ai_rating":5.8,"gap_score":44.9},{"id":"6e6cca29-85c8-4cf8-9411-470c7f7065eb","rank":80,"title":"How LLMs Are Persuaded: A Few Attention Heads, Rerouted","authors":["Xiangkun Sun","Lingkai Kong","Aoqi Zhang","Liang Zeng","Tonghan Wang"],"arxiv_id":"2605.09314v1","link":"http://arxiv.org/abs/2605.09314v1","published":"2026-05-10T04:15:24Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1563,"ts_score":1563,"ts_sigma":2.1415824050018637,"ci":43.0,"wilson_margin":13.7,"win_rate":84.6,"wins":22,"losses":4,"comparisons":26,"ai_rating":7.4,"gap_score":2.5},{"id":"2a7367d7-d2d0-40fc-870b-e0fed0e88185","rank":81,"title":"Process Reward Agents for Steering Knowledge-Intensive Reasoning","authors":["Jiwoong Sohn","Tomasz Sternal","Kenneth Styppa","Torsten Hoefler","Michael Moor"],"arxiv_id":"2604.09482v1","link":"http://arxiv.org/abs/2604.09482v1","published":"2026-04-10T16:45:44Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1563,"ts_score":1563,"ts_sigma":1.190168865006639,"ci":24.0,"wilson_margin":9.2,"win_rate":76.9,"wins":60,"losses":18,"comparisons":78,"ai_rating":7.2,"gap_score":5.7},{"id":"e049c23d-1ec0-4012-9514-02262615f634","rank":82,"title":"The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary","authors":["Dongxin Guo","Jikun Wu","Siu Ming Yiu"],"arxiv_id":"2606.00376v1","link":"http://arxiv.org/abs/2606.00376v1","published":"2026-05-29T21:35:23Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1562,"ts_score":1562,"ts_sigma":2.1870861360182867,"ci":44.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":6.5,"gap_score":25.6},{"id":"9dae88f4-3e49-4aa0-b0b1-1ec534354362","rank":83,"title":"Fusion-fission forecasts when AI will shift to undesirable behavior","authors":["Neil F. Johnson","Frank Yingjie Huo"],"arxiv_id":"2605.14218v1","link":"http://arxiv.org/abs/2605.14218v1","published":"2026-05-14T00:26:32Z","primary_category":"cs.AI","categories":["cs.AI","physics.soc-ph"],"score":1562,"ts_score":1562,"ts_sigma":2.151094812279436,"ci":43.0,"wilson_margin":11.4,"win_rate":92.0,"wins":23,"losses":2,"comparisons":25,"ai_rating":5.5,"gap_score":55.6},{"id":"93ab3a4c-06dc-4589-bdf9-64d422afc4b8","rank":84,"title":"RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time","authors":["Haozhe Wang","Cong Wei","Weiming Ren","Jiaming Liu","Fangzhen Lin","Wenhu Chen"],"arxiv_id":"2604.11626v1","link":"http://arxiv.org/abs/2604.11626v1","published":"2026-04-13T15:38:09Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1562,"ts_score":1562,"ts_sigma":1.3310323116712264,"ci":27.0,"wilson_margin":10.1,"win_rate":76.9,"wins":50,"losses":15,"comparisons":65,"ai_rating":7.4,"gap_score":2.4},{"id":"08da279a-704a-4e0a-87ad-e70439ec2f0d","rank":85,"title":"Participatory provenance as representational auditing for AI-mediated public consultation","authors":["Sachit Mahajan"],"arxiv_id":"2604.20711v1","link":"http://arxiv.org/abs/2604.20711v1","published":"2026-04-22T15:54:16Z","primary_category":"cs.AI","categories":["cs.AI","cs.HC"],"score":1562,"ts_score":1562,"ts_sigma":1.5906925374737841,"ci":32.0,"wilson_margin":13.7,"win_rate":66.7,"wins":28,"losses":14,"comparisons":42,"ai_rating":7.3,"gap_score":3.1},{"id":"5bac9b7d-423f-4b42-a75d-af55f2c73a5f","rank":86,"title":"When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel","authors":["Wenkai Li","Fan Yang","Ananya Hazarika","Shaunak A. Mehta","Koichi Onoue"],"arxiv_id":"2605.11746v1","link":"http://arxiv.org/abs/2605.11746v1","published":"2026-05-12T08:24:47Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1561,"ts_score":1561,"ts_sigma":2.163414819774212,"ci":43.0,"wilson_margin":12.5,"win_rate":88.5,"wins":23,"losses":3,"comparisons":26,"ai_rating":7.5,"gap_score":1.2},{"id":"ee804d7a-d25a-4f19-8da6-c43597e82af3","rank":87,"title":"Solving Inverse Problems of Chaotic Systems with Bidirectional Conditional Flow Matching","authors":["Peiyan Hu","Jian Zhang","Jiashu Pan","Ruiqi Feng","Tao Zhang","Zhi-Ming Ma","Yuan-Sen Ting","Gongjie Li"],"arxiv_id":"2606.24824v1","link":"http://arxiv.org/abs/2606.24824v1","published":"2026-06-23T17:07:47Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1560,"ts_score":1560,"ts_sigma":1.7063169838616585,"ci":34.0,"wilson_margin":14.7,"win_rate":66.7,"wins":24,"losses":12,"comparisons":36,"ai_rating":7.5,"gap_score":1.2},{"id":"7801c068-f1c8-4525-95aa-a2368170062d","rank":88,"title":"Detecting Safety Violations Across Many Agent Traces","authors":["Adam Stein","Davis Brown","Hamed Hassani","Mayur Naik","Eric Wong"],"arxiv_id":"2604.11806v1","link":"http://arxiv.org/abs/2604.11806v1","published":"2026-04-13T17:59:40Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1560,"ts_score":1560,"ts_sigma":1.2708693582002424,"ci":25.0,"wilson_margin":8.8,"win_rate":76.7,"wins":66,"losses":20,"comparisons":86,"ai_rating":6.8,"gap_score":15.9},{"id":"7563d698-ce4d-4d88-b878-f52a744fcf3d","rank":89,"title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","authors":["Guanting Dong","Junting Lu","Junjie Huang","Wanjun Zhong","Longxiang Liu","Shijue Huang","Zhenyu Li","Yang Zhao"],"arxiv_id":"2604.18292v1","link":"http://arxiv.org/abs/2604.18292v1","published":"2026-04-20T14:01:10Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1560,"ts_score":1560,"ts_sigma":1.3138509589638725,"ci":26.0,"wilson_margin":11.8,"win_rate":71.7,"wins":38,"losses":15,"comparisons":53,"ai_rating":7.2,"gap_score":5.5},{"id":"6899961a-cc38-4f04-b9fe-859b09cf383f","rank":90,"title":"Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners","authors":["Botos Csaba","Sreejan Kumar","Austin Tudor David Andrews","Laurence Hunt","Chris Summerfield","Joshua B. Tenenbaum","Rui Ponte Costa","Marcelo G. Mattar"],"arxiv_id":"2605.08019v1","link":"http://arxiv.org/abs/2605.08019v1","published":"2026-05-08T17:07:41Z","primary_category":"cs.AI","categories":["cs.AI","q-bio.NC"],"score":1560,"ts_score":1560,"ts_sigma":2.1404921931903527,"ci":43.0,"wilson_margin":8.8,"win_rate":96.3,"wins":26,"losses":1,"comparisons":27,"ai_rating":7.8,"gap_score":-0.5},{"id":"60657bd4-5462-40da-946c-36f0f87daa12","rank":91,"title":"Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners","authors":["Zheng Lu","Mingqi Gao","Qinlei Xie","Wanqi Zhong","Hanwen Cui","Heng Cao","Zirui Song","Yifan Yang"],"arxiv_id":"2606.01810v1","link":"http://arxiv.org/abs/2606.01810v1","published":"2026-06-01T07:27:39Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1560,"ts_score":1560,"ts_sigma":2.119013992753813,"ci":42.0,"wilson_margin":15.4,"win_rate":85.0,"wins":17,"losses":3,"comparisons":20,"ai_rating":6.5,"gap_score":25.5},{"id":"069123cd-95da-4799-8c7f-d9d29526902e","rank":92,"title":"Conditional Attribute Estimation with Autoregressive Sequence Models","authors":["Erica Stutz","Giacomo Marino","Daniella Meeker","Qiao Liu","Andrew J. Loza"],"arxiv_id":"2605.14004v1","link":"http://arxiv.org/abs/2605.14004v1","published":"2026-05-13T18:11:16Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1560,"ts_score":1560,"ts_sigma":2.1498728744065487,"ci":43.0,"wilson_margin":12.1,"win_rate":88.9,"wins":24,"losses":3,"comparisons":27,"ai_rating":6.8,"gap_score":15.9},{"id":"a54d287f-6f8d-4d73-9593-6938c6452e24","rank":93,"title":"Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems","authors":["Shubham Agarwal","Alexander Krentsel","Shu Liu","Mert Cemri","Audrey Cheng","Rui Meng","Tomas Pfister","Chun-Liang Li"],"arxiv_id":"2605.23109v1","link":"http://arxiv.org/abs/2605.23109v1","published":"2026-05-22T00:05:36Z","primary_category":"cs.AI","categories":["cs.AI","cs.DC","cs.LO","cs.PL"],"score":1559,"ts_score":1559,"ts_sigma":2.1418770929274427,"ci":43.0,"wilson_margin":19.0,"win_rate":59.1,"wins":13,"losses":9,"comparisons":22,"ai_rating":8.2,"gap_score":-1.7},{"id":"21b67042-6cb4-4a2f-a52a-8b106f35ef5d","rank":94,"title":"KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling","authors":["Peng Kuang","Haibo Jin","Xiaoyu Han","Yanli Wang","Xiaopeng Yuan","Ye Yu","Kaidi Xu","Haohan Wang"],"arxiv_id":"2607.09153v1","link":"http://arxiv.org/abs/2607.09153v1","published":"2026-07-10T07:16:43Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1559,"ts_score":1559,"ts_sigma":1.991846612029274,"ci":40.0,"wilson_margin":10.0,"win_rate":89.5,"wins":34,"losses":4,"comparisons":38,"ai_rating":7.0,"gap_score":9.7},{"id":"066bc343-928c-49dd-876d-a13c82936bdc","rank":95,"title":"How Adversarial Environments Mislead Agentic AI?","authors":["Zhonghao Zhan","Huichi Zhou","Zhenhao Li","Peiyuan Jing","Krinos Li","Hamed Haddadi"],"arxiv_id":"2604.18874v1","link":"http://arxiv.org/abs/2604.18874v1","published":"2026-04-20T21:53:39Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1559,"ts_score":1559,"ts_sigma":1.2300246640324,"ci":25.0,"wilson_margin":10.0,"win_rate":69.2,"wins":54,"losses":24,"comparisons":78,"ai_rating":7.8,"gap_score":-0.6},{"id":"8aabb9b4-7efe-4094-b365-a13241c07e07","rank":96,"title":"Formalizing Mathematics at Scale","authors":["Ahmad Rammal","Niket Patel","Fabian Gloeckle","Amaury Hayat","Julia Kempe","Remi Munos","Charles Arnal","Vivien Cabannes"],"arxiv_id":"2605.29955v1","link":"http://arxiv.org/abs/2605.29955v1","published":"2026-05-28T14:00:22Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1558,"ts_score":1558,"ts_sigma":2.114223473337401,"ci":42.0,"wilson_margin":13.7,"win_rate":84.6,"wins":22,"losses":4,"comparisons":26,"ai_rating":8.0,"gap_score":-1.5},{"id":"00d6578f-1d14-456e-aea4-366e3ab40368","rank":97,"title":"OLLM: Options-based Large Language Models","authors":["Shashank Sharma","Janina Hoffmann","Vinay Namboodiri"],"arxiv_id":"2604.19087v1","link":"http://arxiv.org/abs/2604.19087v1","published":"2026-04-21T04:59:37Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1558,"ts_score":1558,"ts_sigma":1.344307564457767,"ci":27.0,"wilson_margin":11.3,"win_rate":75.5,"wins":40,"losses":13,"comparisons":53,"ai_rating":3.8,"gap_score":87.7},{"id":"e5783dd6-c88d-4a5f-8fac-fee2926b20a5","rank":98,"title":"Stress-testing large language model agents in a robotic chemistry laboratory","authors":["Lulu Guo","Yingkai Sun","Xiaobo Li","Luyao Ge","Ziming Wang","Haitao Zheng","Jingyu Li","Huijuan Zhang"],"arxiv_id":"2607.23045v1","link":"http://arxiv.org/abs/2607.23045v1","published":"2026-07-25T05:07:03Z","primary_category":"cs.AI","categories":["cs.AI","cs.RO"],"score":1557,"ts_score":1557,"ts_sigma":2.4161950456775663,"ci":48.0,"wilson_margin":11.0,"win_rate":92.3,"wins":24,"losses":2,"comparisons":26,"ai_rating":7.5,"gap_score":1.0},{"id":"49ee844f-f2b2-4f5d-8871-7ccf8207f265","rank":99,"title":"Calibrating Conservatism for Scalable Oversight","authors":["William Overman","Mohsen Bayati"],"arxiv_id":"2605.28807v1","link":"http://arxiv.org/abs/2605.28807v1","published":"2026-05-27T17:56:47Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1557,"ts_score":1557,"ts_sigma":2.1500700960916492,"ci":43.0,"wilson_margin":16.8,"win_rate":80.0,"wins":16,"losses":4,"comparisons":20,"ai_rating":7.2,"gap_score":5.3},{"id":"ea95d28e-bc6c-4a0f-a22a-a6a39c0e8eeb","rank":100,"title":"MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval","authors":["Shaden Alshammari","Kevin Wen","Abrar Zainal","Mark Hamilton","Navid Safaei","Sultan Albarakati","William T. Freeman","Antonio Torralba"],"arxiv_id":"2604.18584v1","link":"http://arxiv.org/abs/2604.18584v1","published":"2026-04-20T17:59:49Z","primary_category":"cs.AI","categories":["cs.AI","cs.DL","cs.IR","cs.LG"],"score":1556,"ts_score":1556,"ts_sigma":1.4756254166718967,"ci":30.0,"wilson_margin":11.2,"win_rate":76.9,"wins":40,"losses":12,"comparisons":52,"ai_rating":7.2,"gap_score":5.3},{"id":"c25b55a2-6212-40ae-b1e8-cb6605a8ede6","rank":101,"title":"Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact","authors":["Jelena Meyer","David Garcia","Dirk U. Wulff"],"arxiv_id":"2606.20205v1","link":"http://arxiv.org/abs/2606.20205v1","published":"2026-06-18T13:18:37Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.HC"],"score":1556,"ts_score":1556,"ts_sigma":2.1467015163334935,"ci":43.0,"wilson_margin":15.3,"win_rate":75.0,"wins":21,"losses":7,"comparisons":28,"ai_rating":8.8,"gap_score":-2.1},{"id":"a8d68718-cd5d-48a5-b9bd-b6253cc8bf42","rank":102,"title":"Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations","authors":["Hiskias Dingeto"],"arxiv_id":"2607.20379v1","link":"http://arxiv.org/abs/2607.20379v1","published":"2026-07-22T17:10:23Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1556,"ts_score":1556,"ts_sigma":2.166304948582483,"ci":43.0,"wilson_margin":16.0,"win_rate":84.2,"wins":16,"losses":3,"comparisons":19,"ai_rating":6.5,"gap_score":25.2},{"id":"6dd4d500-a913-4221-9763-61ebe8ce1f28","rank":103,"title":"Hidden Biases in Conditioning Autoregressive Models","authors":["Francois Pachet","Pierre Roy"],"arxiv_id":"2604.07855v1","link":"http://arxiv.org/abs/2604.07855v1","published":"2026-04-09T06:12:16Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1556,"ts_score":1556,"ts_sigma":1.1690826194416304,"ci":23.0,"wilson_margin":8.2,"win_rate":76.8,"wins":76,"losses":23,"comparisons":99,"ai_rating":4.5,"gap_score":76.3},{"id":"0c4bd757-5195-4acb-ace2-76e283fcad4f","rank":104,"title":"Agentic Discovery of Exchange-Correlation Density Functionals","authors":["Titouan Duston","Jiashu Liang","Yuanheng Wang","Weihao Gao","Xuelan Wen","Nan Sheng","Weiluo Ren","Yang Sun"],"arxiv_id":"2605.05460v1","link":"http://arxiv.org/abs/2605.05460v1","published":"2026-05-06T21:36:43Z","primary_category":"cs.AI","categories":["cs.AI","physics.chem-ph"],"score":1556,"ts_score":1556,"ts_sigma":2.1780614276304084,"ci":44.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":6.8,"gap_score":15.7},{"id":"cacbdb48-e3cf-4eb5-b1cc-1ae94a74ec5c","rank":105,"title":"The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure","authors":["Qiqi Liu","Thorsten Holz","Shilin Ye","Runhan Song"],"arxiv_id":"2605.17480v1","link":"http://arxiv.org/abs/2605.17480v1","published":"2026-05-17T14:42:44Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1555,"ts_score":1555,"ts_sigma":2.112970330507712,"ci":42.0,"wilson_margin":15.6,"win_rate":81.8,"wins":18,"losses":4,"comparisons":22,"ai_rating":7.8,"gap_score":-0.9},{"id":"c99f0469-98ec-4c78-9a96-6be77a88f4f9","rank":106,"title":"ResearchEVO: An End-to-End Framework for Automated Scientific Discovery and Documentation","authors":["Zhe Zhao","Haibin Wen","Jiaming Ma","Jiachang Zhan","Tianyi Xu","Ye Wei","Qingfu Zhang"],"arxiv_id":"2604.05587v1","link":"http://arxiv.org/abs/2604.05587v1","published":"2026-04-07T08:29:41Z","primary_category":"cs.AI","categories":["cs.AI","math.OC"],"score":1555,"ts_score":1555,"ts_sigma":0.9378516285742537,"ci":19.0,"wilson_margin":6.8,"win_rate":71.5,"wins":118,"losses":47,"comparisons":165,"ai_rating":5.5,"gap_score":55.0},{"id":"be909e30-cafa-470a-98da-603d001eb612","rank":107,"title":"Bias by Necessity: Impossibility Theorems for Sequential Processing with Convergent AI and Human Validation","authors":["Jikun Wu","Dongxin Guo","Siu-Ming Yiu"],"arxiv_id":"2605.08716v1","link":"http://arxiv.org/abs/2605.08716v1","published":"2026-05-09T05:56:12Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1555,"ts_score":1555,"ts_sigma":2.1726794917985823,"ci":43.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":5.5,"gap_score":55.0},{"id":"84753376-828c-43d8-8d31-195d53423450","rank":108,"title":"Agentic evolution of physically constrained foundation models","authors":["Jiangwei Zhang","Wen Sun","Chong Wang","Shiyao Li","Cheng Che","Chunjing Han","Dan Meng","Jian Yang"],"arxiv_id":"2606.25532v1","link":"http://arxiv.org/abs/2606.25532v1","published":"2026-06-24T08:07:59Z","primary_category":"cs.AI","categories":["cs.AI","cs.AR","cs.LG","cs.MA"],"score":1555,"ts_score":1555,"ts_sigma":2.125923077750787,"ci":43.0,"wilson_margin":16.2,"win_rate":81.0,"wins":17,"losses":4,"comparisons":21,"ai_rating":5.8,"gap_score":44.3},{"id":"43d6199c-5b7d-4ef8-99ac-d00dcaafb672","rank":109,"title":"ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D","authors":["Lena Libon","Ben Rank","Jehyeok Yeon","David Schmotz","Jeremy Qin","Daniel Donnelly","Derck Prinzhorn","Maksym Andriushchenko"],"arxiv_id":"2607.19321v1","link":"http://arxiv.org/abs/2607.19321v1","published":"2026-07-21T17:41:12Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR","cs.LG"],"score":1555,"ts_score":1555,"ts_sigma":2.162375798220225,"ci":43.0,"wilson_margin":17.4,"win_rate":82.4,"wins":14,"losses":3,"comparisons":17,"ai_rating":6.5,"gap_score":25.1},{"id":"05add51b-7810-4f29-9d81-31d8c1db3357","rank":110,"title":"Towards a Science of AI Agent Reliability","authors":["Stephan Rabanser","Sayash Kapoor","Peter Kirgis","Kangheng Liu","Saiteja Utpala","Arvind Narayanan"],"arxiv_id":"2602.16666v3","link":"https://arxiv.org/abs/2602.16666","published":"2026-02-18T18:05:44Z","primary_category":"cs.AI","categories":["cs.AI","cs.CY","cs.LG"],"score":1555,"ts_score":1555,"ts_sigma":2.132339118696973,"ci":43.0,"wilson_margin":15.1,"win_rate":82.6,"wins":19,"losses":4,"comparisons":23,"ai_rating":7.8,"gap_score":-0.9},{"id":"faf74aa0-3705-4b55-be8f-cd3e6065c7de","rank":111,"title":"RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning","authors":["Xi Chen","Hongru Zhou","Shiyu Feng","Hanyu Zhou","Huahui Yi","Rongsheng Wang","Tiancheng He","Kun Wang"],"arxiv_id":"2607.23290v1","link":"http://arxiv.org/abs/2607.23290v1","published":"2026-07-25T16:58:10Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1554,"ts_score":1554,"ts_sigma":2.327919674949117,"ci":47.0,"wilson_margin":16.7,"win_rate":83.3,"wins":15,"losses":3,"comparisons":18,"ai_rating":7.0,"gap_score":9.4},{"id":"be4e3154-069b-48bf-b9fb-b118c6f2e37c","rank":112,"title":"EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics","authors":["Shuyue Stella Li","Rui Xin","Teng Xiao","Yike Wang","Rulin Shao","Zoey Hao","Melanie Sclar","Sewoong Oh"],"arxiv_id":"2605.03871v1","link":"http://arxiv.org/abs/2605.03871v1","published":"2026-05-05T15:31:00Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1553,"ts_score":1553,"ts_sigma":2.114968916394634,"ci":42.0,"wilson_margin":15.0,"win_rate":69.7,"wins":23,"losses":10,"comparisons":33,"ai_rating":7.8,"gap_score":-1.0},{"id":"503f6799-f505-4870-b9f3-3e2a20000c7b","rank":113,"title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","authors":["Yucheng Shi","Zhenwen Liang","Kishan Panaganti","Dian Yu","Wenhao Yu","Haitao Mi"],"arxiv_id":"2605.14392v1","link":"http://arxiv.org/abs/2605.14392v1","published":"2026-05-14T05:14:45Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1553,"ts_score":1553,"ts_sigma":2.1189734720510023,"ci":42.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":6.8,"gap_score":15.4},{"id":"1484e62d-5d8c-49ae-b16f-56ba9a1c6db7","rank":114,"title":"CIVeX: Causal Intervention Verification for Language Agents","authors":["Fabio Rovai"],"arxiv_id":"2605.09168v1","link":"http://arxiv.org/abs/2605.09168v1","published":"2026-05-09T21:06:15Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1553,"ts_score":1553,"ts_sigma":2.142420754878222,"ci":43.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":5.8,"gap_score":44.2},{"id":"9be9c98f-2d5b-4548-8d98-99f9aea402b0","rank":115,"title":"Reasoning Can Be Restored by Correcting a Few Decision Tokens","authors":["Changshuo Shen","Leheng Sheng","Yuxin Chen","An Zhang","Xiang Wang"],"arxiv_id":"2605.16874v1","link":"http://arxiv.org/abs/2605.16874v1","published":"2026-05-16T08:33:31Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1552,"ts_score":1552,"ts_sigma":2.160907403650213,"ci":43.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":7.4,"gap_score":1.7},{"id":"5670490e-def9-45fc-8ccb-7b920805574b","rank":116,"title":"Characterizing Model-Native Skills","authors":["Feiyang Kang","Mahavir Dabas","Myeongseob Ko","Ruoxi Jia"],"arxiv_id":"2604.17614v1","link":"http://arxiv.org/abs/2604.17614v1","published":"2026-04-19T20:58:25Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1552,"ts_score":1552,"ts_sigma":1.505333073141056,"ci":30.0,"wilson_margin":13.2,"win_rate":62.5,"wins":30,"losses":18,"comparisons":48,"ai_rating":5.8,"gap_score":44.1},{"id":"0d39d002-cf83-4ec3-8d4a-5e19cb78533c","rank":117,"title":"Agentic generation of verifiable rules for deterministic, self-expanding reaction classification","authors":["Daniel Armstrong","Maarten Dobbelaere","Valentas Olikauskas","Helena Avila","Octavian Susanu","Jérôme Waser","Philippe Schwaller"],"arxiv_id":"2607.01061v1","link":"http://arxiv.org/abs/2607.01061v1","published":"2026-07-01T15:24:06Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1552,"ts_score":1552,"ts_sigma":2.1775825249707594,"ci":44.0,"wilson_margin":15.1,"win_rate":82.6,"wins":19,"losses":4,"comparisons":23,"ai_rating":7.5,"gap_score":0.6},{"id":"f65f96c8-e2b2-4306-8ffb-4ad642474ff0","rank":118,"title":"Data Language Models: A New Foundation Model Class for Tabular Data","authors":["Eda Erol","Giuliano Pezzoli","Ozer Cem Kelahmet"],"arxiv_id":"2605.06290v1","link":"http://arxiv.org/abs/2605.06290v1","published":"2026-05-07T13:56:49Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1551,"ts_score":1551,"ts_sigma":2.131224498493732,"ci":43.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":4.0,"gap_score":85.0},{"id":"a86695e3-6c06-44f4-a702-cbb81d032643","rank":119,"title":"Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning","authors":["Sixing Chen","Ji-An Li","Saner Cakir","Sinan Akcali","Kayla Lee","Marcelo G. Mattar"],"arxiv_id":"2605.06840v1","link":"http://arxiv.org/abs/2605.06840v1","published":"2026-05-07T18:45:46Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1551,"ts_score":1551,"ts_sigma":2.1596060611556283,"ci":43.0,"wilson_margin":14.0,"win_rate":74.3,"wins":26,"losses":9,"comparisons":35,"ai_rating":7.8,"gap_score":-1.1},{"id":"7bf9ccbd-ba14-4728-b287-aa3bfa879568","rank":120,"title":"Introspection Adapters: Training LLMs to Report Their Learned Behaviors","authors":["Keshav Shenoy","Li Yang","Abhay Sheshadri","Sören Mindermann","Jack Lindsey","Sam Marks","Rowan Wang"],"arxiv_id":"2604.16812v2","link":"http://arxiv.org/abs/2604.16812v2","published":"2026-04-18T03:50:00Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1551,"ts_score":1551,"ts_sigma":1.760543326324938,"ci":35.0,"wilson_margin":14.4,"win_rate":75.0,"wins":24,"losses":8,"comparisons":32,"ai_rating":7.8,"gap_score":-1.1},{"id":"e2ecc474-c9c6-441f-a5cb-97cf1030cea8","rank":121,"title":"PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments","authors":["Ruoqi Liu","Imran Q. Mohiuddin","Austin J. Schoeffler","Kavita Renduchintala","Ashwin Nayak","Prasantha L. Vemu","Shivam C. Vedak","Kameron C. Black"],"arxiv_id":"2605.02240v1","link":"http://arxiv.org/abs/2605.02240v1","published":"2026-05-04T05:32:25Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1550,"ts_score":1550,"ts_sigma":1.643735281161942,"ci":33.0,"wilson_margin":6.3,"win_rate":91.2,"wins":73,"losses":7,"comparisons":80,"ai_rating":7.5,"gap_score":0.5},{"id":"a86ac3e8-3d1d-460c-98a7-b0123d6c4231","rank":122,"title":"Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack","authors":["Long P. Hoang","Hai V. Le","Shaoyang Xu","Wei Lu","Wenxuan Zhang"],"arxiv_id":"2606.05614v1","link":"https://arxiv.org/abs/2606.05614","published":"2026-06-04T02:36:41Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1550,"ts_score":1550,"ts_sigma":2.13591878679188,"ci":43.0,"wilson_margin":12.4,"win_rate":84.4,"wins":27,"losses":5,"comparisons":32,"ai_rating":7.0,"gap_score":9.1},{"id":"9c99b614-0ed6-4e3b-807c-aae2302cdebc","rank":123,"title":"DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents","authors":["Zhaorun Chen","Xun Liu","Haibo Tong","Chengquan Guo","Yuzhou Nie","Jiawei Zhang","Mintong Kang","Chejian Xu"],"arxiv_id":"2605.04808v1","link":"http://arxiv.org/abs/2605.04808v1","published":"2026-05-06T11:59:48Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1547,"ts_score":1547,"ts_sigma":2.128236649909904,"ci":43.0,"wilson_margin":13.3,"win_rate":87.5,"wins":21,"losses":3,"comparisons":24,"ai_rating":8.5,"gap_score":-2.5},{"id":"661a9d6d-c33d-4ac6-9bf7-3aa22c7a4cb8","rank":124,"title":"Beyond One-shot: AI Agents for Learning in Field Experiments","authors":["Junjie Luo","Ritu Agarwal","Gordon Gao"],"arxiv_id":"2606.02458v1","link":"http://arxiv.org/abs/2606.02458v1","published":"2026-06-01T16:30:42Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1547,"ts_score":1547,"ts_sigma":2.058955416384064,"ci":41.0,"wilson_margin":12.4,"win_rate":84.4,"wins":27,"losses":5,"comparisons":32,"ai_rating":6.5,"gap_score":24.8},{"id":"9e31354b-0f90-4bd5-a9fa-599a6ded366e","rank":125,"title":"Measuring Intelligence Beyond Human Scale","authors":["Jerry Han","Rafael Moschopoulos","Ella Colby","Vishrut Goyal","Andrew Tu","Kia Ghods","Mark Braverman","Elad Hazan"],"arxiv_id":"2607.07040v1","link":"http://arxiv.org/abs/2607.07040v1","published":"2026-07-08T06:19:10Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1546,"ts_score":1546,"ts_sigma":2.154372504511043,"ci":43.0,"wilson_margin":15.4,"win_rate":85.0,"wins":17,"losses":3,"comparisons":20,"ai_rating":6.8,"gap_score":15.1},{"id":"93eff534-1cbe-4cbc-8c79-553a514cebed","rank":126,"title":"Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning","authors":["Zach Studdiford","Gary Lupyan"],"arxiv_id":"2606.13607v1","link":"http://arxiv.org/abs/2606.13607v1","published":"2026-06-11T17:23:10Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1546,"ts_score":1546,"ts_sigma":1.4157717459838812,"ci":28.0,"wilson_margin":14.1,"win_rate":54.5,"wins":24,"losses":20,"comparisons":44,"ai_rating":7.8,"gap_score":-1.3},{"id":"87533d40-ab38-420c-bcf9-55bc6aeac5eb","rank":127,"title":"SPADE: Structure-Prior Adaptive Decision Estimation","authors":["Yifan Wang"],"arxiv_id":"2606.23219v1","link":"http://arxiv.org/abs/2606.23219v1","published":"2026-06-22T12:07:27Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1546,"ts_score":1546,"ts_sigma":1.6701122124070966,"ci":33.0,"wilson_margin":13.7,"win_rate":68.3,"wins":28,"losses":13,"comparisons":41,"ai_rating":6.5,"gap_score":24.7},{"id":"66fbb9f3-3630-440d-a20e-256b934c6e6b","rank":128,"title":"Resolving the bias-precision paradox with stochastic causal representation learning for personalized medicine","authors":["Peisong Zhang","Manqiang Peng","Yuxuan Wu","Pawit Phadungsaksawasdi","Wesley Yeung","Ye Zhang","Trang Nguyen","Qiang Zhang"],"arxiv_id":"2605.05706v1","link":"http://arxiv.org/abs/2605.05706v1","published":"2026-05-07T05:51:21Z","primary_category":"cs.AI","categories":["cs.AI","q-bio.QM"],"score":1546,"ts_score":1546,"ts_sigma":2.0062649228331777,"ci":40.0,"wilson_margin":13.3,"win_rate":85.2,"wins":23,"losses":4,"comparisons":27,"ai_rating":6.8,"gap_score":15.1},{"id":"0c34f443-37a3-4f58-aa09-be6f2d1fffab","rank":129,"title":"Medical world models: representing medical states, modelling clinical dynamics and guiding intervention policies","authors":["Ke Liu","Mengxuan Li","Yanyi Bao","Tianyun Zhang","Chong Chu","Jiajun Bu","Haishuai Wang"],"arxiv_id":"2606.16721v1","link":"http://arxiv.org/abs/2606.16721v1","published":"2026-06-15T13:49:43Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1546,"ts_score":1546,"ts_sigma":2.1298089597431904,"ci":43.0,"wilson_margin":13.1,"win_rate":83.3,"wins":25,"losses":5,"comparisons":30,"ai_rating":6.2,"gap_score":33.8},{"id":"58f45120-2636-45d5-ac5a-29a56cf98e53","rank":130,"title":"SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio","authors":["Satwik Pandey","Suresh Raghu","Shashwat Pandey"],"arxiv_id":"2604.06389v1","link":"http://arxiv.org/abs/2604.06389v1","published":"2026-04-07T19:19:29Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1545,"ts_score":1545,"ts_sigma":1.1066824693087163,"ci":22.0,"wilson_margin":8.8,"win_rate":73.4,"wins":69,"losses":25,"comparisons":94,"ai_rating":5.5,"gap_score":54.5},{"id":"1d42b358-d0a8-41e7-9091-259d5bb6bc02","rank":131,"title":"Automated reproducibility assessments in the social and behavioral sciences using large language models","authors":["Tobias Holtdirk","Pietro Marcolongo","Anna Steinberg Schulten","Felix Henninger","Stefan Rose","Sarah Ball","Bolei Ma","Frauke Kreuter"],"arxiv_id":"2606.13670v1","link":"http://arxiv.org/abs/2606.13670v1","published":"2026-06-11T17:58:36Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1545,"ts_score":1545,"ts_sigma":2.15440648225433,"ci":43.0,"wilson_margin":14.1,"win_rate":84.0,"wins":21,"losses":4,"comparisons":25,"ai_rating":5.5,"gap_score":54.5},{"id":"07cceae6-2e51-4920-825d-c7744c1bd192","rank":132,"title":"Abstract representational geometry supports inference in large language models","authors":["Yunan Zeng","Yuwang Wang"],"arxiv_id":"2606.23345v1","link":"http://arxiv.org/abs/2606.23345v1","published":"2026-06-22T13:50:34Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1545,"ts_score":1545,"ts_sigma":2.146986687748523,"ci":43.0,"wilson_margin":18.5,"win_rate":73.7,"wins":14,"losses":5,"comparisons":19,"ai_rating":6.8,"gap_score":15.0},{"id":"e19f1485-1d8e-4d6e-9298-47751b3a1600","rank":133,"title":"Persistent Computational State: A Session-Centric Runtime for Generative World Models","authors":["Zhen Lin"],"arxiv_id":"2607.21686v1","link":"http://arxiv.org/abs/2607.21686v1","published":"2026-07-23T14:39:46Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1544,"ts_score":1544,"ts_sigma":2.127700316396609,"ci":43.0,"wilson_margin":15.5,"win_rate":76.9,"wins":20,"losses":6,"comparisons":26,"ai_rating":7.0,"gap_score":8.8},{"id":"6e2f4d0c-1916-419c-a656-654fd8e5802f","rank":134,"title":"Recursive Multi-Agent Systems","authors":["Xiyuan Yang","Jiaru Zou","Rui Pan","Ruizhong Qiu","Pan Lu","Shizhe Diao","Jindong Jiang","Hanghang Tong"],"arxiv_id":"2604.25917v1","link":"http://arxiv.org/abs/2604.25917v1","published":"2026-04-28T17:59:34Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1544,"ts_score":1544,"ts_sigma":1.7425509543391922,"ci":35.0,"wilson_margin":14.6,"win_rate":61.5,"wins":24,"losses":15,"comparisons":39,"ai_rating":7.4,"gap_score":1.3},{"id":"049d5c0f-d6fc-4c71-a1b1-f18c93f1030e","rank":135,"title":"AI Co-Mathematician: Accelerating Mathematicians with Agentic AI","authors":["Daniel Zheng","Ingrid von Glehn","Yori Zwols","Iuliya Beloshapka","Lars Buesing","Daniel M. Roy","Martin Wattenberg","Bogdan Georgiev"],"arxiv_id":"2605.06651v1","link":"http://arxiv.org/abs/2605.06651v1","published":"2026-05-07T17:56:32Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1544,"ts_score":1544,"ts_sigma":2.1587808576777796,"ci":43.0,"wilson_margin":10.5,"win_rate":95.5,"wins":21,"losses":1,"comparisons":22,"ai_rating":7.2,"gap_score":4.6},{"id":"032739cb-a4a2-4902-a9cf-233a96c61f39","rank":136,"title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","authors":["Yu Li","Sizhe Tang","Tian Lan"],"arxiv_id":"2604.07165v1","link":"http://arxiv.org/abs/2604.07165v1","published":"2026-04-08T14:55:29Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1544,"ts_score":1544,"ts_sigma":1.1039042121954334,"ci":22.0,"wilson_margin":9.5,"win_rate":70.6,"wins":60,"losses":25,"comparisons":85,"ai_rating":6.5,"gap_score":24.5},{"id":"f19a49c6-f8f1-490a-b7bf-582c5c83214a","rank":137,"title":"Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics","authors":["Haonan Huang"],"arxiv_id":"2607.02329v1","link":"http://arxiv.org/abs/2607.02329v1","published":"2026-07-02T15:35:41Z","primary_category":"cs.AI","categories":["cs.AI","cond-mat.mtrl-sci","physics.comp-ph"],"score":1543,"ts_score":1543,"ts_sigma":2.1690918918182436,"ci":43.0,"wilson_margin":16.1,"win_rate":78.3,"wins":18,"losses":5,"comparisons":23,"ai_rating":7.5,"gap_score":0.1},{"id":"efb2c62e-9d73-40ed-9e78-6983663c3ec2","rank":138,"title":"The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure","authors":["Rahul Kumar"],"arxiv_id":"2605.02398v1","link":"http://arxiv.org/abs/2605.02398v1","published":"2026-05-04T09:40:21Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG"],"score":1543,"ts_score":1543,"ts_sigma":1.5706670688192914,"ci":31.0,"wilson_margin":7.9,"win_rate":87.1,"wins":61,"losses":9,"comparisons":70,"ai_rating":6.5,"gap_score":24.4},{"id":"bd9768eb-d6a2-479d-a43f-7f0bc4a86767","rank":139,"title":"Distribution-Aware Algorithm Design with LLM Agents","authors":["Saharsh Koganti","Priyadarsi Mishra","Pierfrancesco Beneventano","Tomer Galanti"],"arxiv_id":"2605.14141v1","link":"http://arxiv.org/abs/2605.14141v1","published":"2026-05-13T21:47:55Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1543,"ts_score":1543,"ts_sigma":2.149774367061297,"ci":43.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":7.4,"gap_score":1.2},{"id":"8453951f-7b22-429c-bb17-6868304223b2","rank":140,"title":"PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations","authors":["Yang Zhang","Jiangyuan Zhao","Chenyou Fan","Fangzheng Yan","Tian Li","Haitong Tang","Sen Fu","Xuan'er Wu"],"arxiv_id":"2604.27472v1","link":"http://arxiv.org/abs/2604.27472v1","published":"2026-04-30T06:14:02Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","cs.RO"],"score":1543,"ts_score":1543,"ts_sigma":1.7465860798185746,"ci":35.0,"wilson_margin":15.1,"win_rate":73.3,"wins":22,"losses":8,"comparisons":30,"ai_rating":7.8,"gap_score":-1.5},{"id":"28d06088-52c3-420d-800a-3d15b13480ee","rank":141,"title":"Separable Expert Architecture: Toward Privacy-Preserving LLM Personalization via Composable Adapters and Deletable User Proxies","authors":["Chris Schneider","Philipp Schoenegger","Ben Bariach"],"arxiv_id":"2604.21571v1","link":"http://arxiv.org/abs/2604.21571v1","published":"2026-04-23T11:51:31Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1543,"ts_score":1543,"ts_sigma":1.4672662376545083,"ci":29.0,"wilson_margin":14.1,"win_rate":63.4,"wins":26,"losses":15,"comparisons":41,"ai_rating":5.0,"gap_score":64.3},{"id":"27252321-923e-4c7e-8028-e66b4bfd8d88","rank":142,"title":"LACE: Lattice Attention for Cross-thread Exploration","authors":["Yang Li","Zirui Zhang","Yang Liu","Chengzhi Mao"],"arxiv_id":"2604.15529v1","link":"http://arxiv.org/abs/2604.15529v1","published":"2026-04-16T21:19:35Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1543,"ts_score":1543,"ts_sigma":1.2231450065794893,"ci":24.0,"wilson_margin":10.5,"win_rate":72.7,"wins":48,"losses":18,"comparisons":66,"ai_rating":6.2,"gap_score":33.5},{"id":"f1c3a76c-fd8d-4c6e-acae-57c07891292f","rank":143,"title":"Self-Programmed Execution for Language-Model Agents","authors":["Luke J. O'Connor"],"arxiv_id":"2605.06898v1","link":"http://arxiv.org/abs/2605.06898v1","published":"2026-05-07T19:58:28Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1542,"ts_score":1542,"ts_sigma":2.173501735421063,"ci":43.0,"wilson_margin":12.6,"win_rate":90.9,"wins":20,"losses":2,"comparisons":22,"ai_rating":7.0,"gap_score":8.6},{"id":"4acce929-5c02-4f5f-835a-32d01da7ed58","rank":144,"title":"LAP: An Agent-to-Instrument Protocol for Autonomous Science","authors":["Linwu Zhu","Liqiang Gao","Yan Chen","Dan Zhu","Jian Huang"],"arxiv_id":"2606.03755v1","link":"http://arxiv.org/abs/2606.03755v1","published":"2026-06-02T15:03:43Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1542,"ts_score":1542,"ts_sigma":2.1266263073529785,"ci":43.0,"wilson_margin":14.6,"win_rate":83.3,"wins":20,"losses":4,"comparisons":24,"ai_rating":6.0,"gap_score":37.0},{"id":"3daa7457-78fd-4e02-adaf-6fcdd572b717","rank":145,"title":"Decomposing how prompting steers behavior","authors":["Fan L. Cheng","Nikolaus Kriegeskorte"],"arxiv_id":"2606.03093v1","link":"http://arxiv.org/abs/2606.03093v1","published":"2026-06-02T03:27:24Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1542,"ts_score":1542,"ts_sigma":2.1201691872719333,"ci":42.0,"wilson_margin":14.3,"win_rate":86.4,"wins":19,"losses":3,"comparisons":22,"ai_rating":7.0,"gap_score":8.6},{"id":"3c0162e7-9c05-407c-ba34-2a4680dfb892","rank":146,"title":"What Can Be Enforced? A Theory of Certified Runtime Safety for Tool-Using Agents","authors":["Shawn Ray"],"arxiv_id":"2607.22868v1","link":"http://arxiv.org/abs/2607.22868v1","published":"2026-07-24T19:14:26Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR","cs.LG"],"score":1542,"ts_score":1542,"ts_sigma":2.312978096121715,"ci":46.0,"wilson_margin":15.6,"win_rate":81.8,"wins":18,"losses":4,"comparisons":22,"ai_rating":6.5,"gap_score":24.3},{"id":"2d409e97-8e2a-43e3-9fb1-06d270c24595","rank":147,"title":"When Can Human-AI Teams Outperform Individuals? Tight Bounds with Impossibility Guarantees","authors":["Dongxin Guo","Jikun Wu","Siu-Ming Yiu"],"arxiv_id":"2605.08710v1","link":"http://arxiv.org/abs/2605.08710v1","published":"2026-05-09T05:46:11Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1542,"ts_score":1542,"ts_sigma":2.1656419954017716,"ci":43.0,"wilson_margin":10.5,"win_rate":95.5,"wins":21,"losses":1,"comparisons":22,"ai_rating":7.0,"gap_score":8.6},{"id":"9ff4852c-6885-422f-a3c7-8b7de72a717b","rank":148,"title":"Hallucination as Exploit: Evidence-Carrying Multimodal Agents","authors":["Guijia Zhang","Hao Zheng","Harry Yang"],"arxiv_id":"2605.19192v1","link":"http://arxiv.org/abs/2605.19192v1","published":"2026-05-18T23:40:43Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR"],"score":1541,"ts_score":1541,"ts_sigma":2.177780824463224,"ci":44.0,"wilson_margin":19.0,"win_rate":59.1,"wins":13,"losses":9,"comparisons":22,"ai_rating":7.2,"gap_score":4.2},{"id":"8c9ca8ed-d8fc-492e-a8be-f6741b2ae26e","rank":149,"title":"A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization","authors":["Tianyu Liu","Wangjie Zheng","Rui Yang","Benny Kai Guo Loo","Hui Zhang","Jeffries Lauran","Jianlei Gu","Botao Yu"],"arxiv_id":"2605.06226v1","link":"http://arxiv.org/abs/2605.06226v1","published":"2026-05-07T13:19:42Z","primary_category":"cs.AI","categories":["cs.AI","q-bio.GN"],"score":1541,"ts_score":1541,"ts_sigma":2.147321686969877,"ci":43.0,"wilson_margin":16.1,"win_rate":78.3,"wins":18,"losses":5,"comparisons":23,"ai_rating":6.2,"gap_score":33.3},{"id":"24548f11-9a54-4aa1-8708-c8014bf0b6c2","rank":150,"title":"Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment","authors":["Tanav Singh Bajaj","Nikhil Singh","Karan Anand","Eishkaran Singh"],"arxiv_id":"2605.01147v1","link":"http://arxiv.org/abs/2605.01147v1","published":"2026-05-01T22:49:10Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1541,"ts_score":1541,"ts_sigma":1.7753022634707922,"ci":36.0,"wilson_margin":13.8,"win_rate":76.5,"wins":26,"losses":8,"comparisons":34,"ai_rating":5.5,"gap_score":54.2},{"id":"cc357399-668d-48c8-915f-61777f8d7f97","rank":151,"title":"SWE-chat: Coding Agent Interactions From Real Users in the Wild","authors":["Joachim Baumann","Vishakh Padmakumar","Xiang Li","John Yang","Diyi Yang","Sanmi Koyejo"],"arxiv_id":"2604.20779v1","link":"http://arxiv.org/abs/2604.20779v1","published":"2026-04-22T17:08:19Z","primary_category":"cs.AI","categories":["cs.AI","cs.CY","cs.SE"],"score":1540,"ts_score":1540,"ts_sigma":1.7076718822095973,"ci":34.0,"wilson_margin":12.5,"win_rate":70.8,"wins":34,"losses":14,"comparisons":48,"ai_rating":7.4,"gap_score":0.9},{"id":"b933a659-7f75-406f-b583-0bdc57e42d59","rank":152,"title":"Rollout Cards: A Reproducibility Standard for Agent Research","authors":["Charlie Masters","Ziyuan Liu","Stefano V. Albrecht"],"arxiv_id":"2605.12131v1","link":"http://arxiv.org/abs/2605.12131v1","published":"2026-05-12T13:54:31Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1540,"ts_score":1540,"ts_sigma":2.0030213399803825,"ci":40.0,"wilson_margin":10.3,"win_rate":92.9,"wins":26,"losses":2,"comparisons":28,"ai_rating":7.2,"gap_score":4.1},{"id":"962a1144-0ab7-43c5-904b-2b3169541dc0","rank":153,"title":"Unlocking LLM Creativity in Science through Analogical Reasoning","authors":["Andrew Shen","Shaul Druckmann","James Zou"],"arxiv_id":"2605.11258v1","link":"http://arxiv.org/abs/2605.11258v1","published":"2026-05-11T21:35:44Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","q-bio.QM"],"score":1540,"ts_score":1540,"ts_sigma":2.163229846364304,"ci":43.0,"wilson_margin":13.7,"win_rate":84.6,"wins":22,"losses":4,"comparisons":26,"ai_rating":7.2,"gap_score":4.1},{"id":"82c3e6e4-d5c9-4fa4-bc67-a9eb8ca74d79","rank":154,"title":"Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification","authors":["Yunhao Feng","Ruixiao Lin","Ming Wen","Qinqin He","Yanming Guo","Yifan Ding","Yutao Wu","Jialuo Chen"],"arxiv_id":"2607.01793v1","link":"http://arxiv.org/abs/2607.01793v1","published":"2026-07-02T07:08:26Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1540,"ts_score":1540,"ts_sigma":2.1696382902166453,"ci":43.0,"wilson_margin":15.1,"win_rate":80.0,"wins":20,"losses":5,"comparisons":25,"ai_rating":7.3,"gap_score":1.5},{"id":"7da35bc9-dde7-4c82-89fb-3cfdf9d578df","rank":155,"title":"SMCEvolve: Principled Scientific Discovery via Sequential Monte Carlo Evolution","authors":["Jiachen Jiang","Huminhao Zhu","Zhihui Zhu"],"arxiv_id":"2605.15308v1","link":"http://arxiv.org/abs/2605.15308v1","published":"2026-05-14T18:21:08Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","cs.MA"],"score":1540,"ts_score":1540,"ts_sigma":2.045423314322122,"ci":41.0,"wilson_margin":16.2,"win_rate":61.3,"wins":19,"losses":12,"comparisons":31,"ai_rating":7.4,"gap_score":0.9},{"id":"6ae342f5-d25b-4df7-b367-81070eb1d823","rank":156,"title":"CauSim: Scaling Causal Reasoning with Increasingly Complex Causal Simulators","authors":["Nicolás Astorga","Anita Kriz","Mihaela van der Schaar"],"arxiv_id":"2605.09079v1","link":"http://arxiv.org/abs/2605.09079v1","published":"2026-05-09T17:39:26Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1540,"ts_score":1540,"ts_sigma":2.1352283534552083,"ci":43.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":6.5,"gap_score":24.1},{"id":"586cf4f7-ef4b-4ebf-899b-d9d31bb4aa22","rank":157,"title":"PRISM: Recovering Instruction Sets from Language Model Activations","authors":["Gilad Gressel","Rahul Pankajakshan","Julia Diament","Efim Hudis","Krishnashree Achuthan","Yisroel Mirsky"],"arxiv_id":"2606.09563v1","link":"http://arxiv.org/abs/2606.09563v1","published":"2026-06-08T14:37:46Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1540,"ts_score":1540,"ts_sigma":2.1458153910638393,"ci":43.0,"wilson_margin":14.1,"win_rate":84.0,"wins":21,"losses":4,"comparisons":25,"ai_rating":7.2,"gap_score":4.1},{"id":"42861a3c-8881-4526-b764-7fcefaf0d014","rank":158,"title":"Transferable Human Mobility Network Reconstruction with neuroGravity","authors":["Jinming Yang","Shaoyu Huang","Zongyuan Huang","Yaohui Jin","Xiaokang Yang","Marta C. Gonzalez","Yanyan Xu"],"arxiv_id":"2604.23678v1","link":"http://arxiv.org/abs/2604.23678v1","published":"2026-04-26T12:33:07Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1540,"ts_score":1540,"ts_sigma":1.7392658397822764,"ci":35.0,"wilson_margin":13.7,"win_rate":68.3,"wins":28,"losses":13,"comparisons":41,"ai_rating":7.8,"gap_score":-1.9},{"id":"41fdd9f6-8307-419d-926f-81f83ac05b58","rank":159,"title":"From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models","authors":["Ling Shi","Xinwei Wu","Xiaohu Zhao","Hao Wang","Heng Liu","Yangyang Liu","Linlong Xu","Longyue Wang"],"arxiv_id":"2604.25167v1","link":"http://arxiv.org/abs/2604.25167v1","published":"2026-04-28T03:16:24Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1540,"ts_score":1540,"ts_sigma":1.6296524066013711,"ci":33.0,"wilson_margin":13.4,"win_rate":63.0,"wins":29,"losses":17,"comparisons":46,"ai_rating":6.2,"gap_score":33.2},{"id":"0c4bc6cb-5e02-4f6b-bd65-1f9c62eb62b4","rank":160,"title":"QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems","authors":["Chenyang An","Qihao Ye","Minghao Pan","Jiayaun Zhang"],"arxiv_id":"2604.24021v2","link":"http://arxiv.org/abs/2604.24021v2","published":"2026-04-27T04:10:02Z","primary_category":"cs.AI","categories":["cs.AI","math.AP"],"score":1540,"ts_score":1540,"ts_sigma":1.7694166702585268,"ci":35.0,"wilson_margin":14.6,"win_rate":57.5,"wins":23,"losses":17,"comparisons":40,"ai_rating":5.8,"gap_score":43.2,"current_version":2},{"id":"ec7ca789-5621-4503-bdf4-a7c39be05c15","rank":161,"title":"Subliminal Learning Is Steering Vector Distillation","authors":["Camila Blank","Agam Bhatia","Senthooran Rajamanoharan","Arthur Conmy","Neel Nanda"],"arxiv_id":"2606.00995v1","link":"http://arxiv.org/abs/2606.00995v1","published":"2026-05-31T04:22:44Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1539,"ts_score":1539,"ts_sigma":2.169182364240691,"ci":43.0,"wilson_margin":12.5,"win_rate":86.2,"wins":25,"losses":4,"comparisons":29,"ai_rating":7.2,"gap_score":3.9},{"id":"d6b91a92-6f7e-442e-8cf6-04dbae2884c6","rank":162,"title":"Inference Time Context Sparsity: Illusion or Opportunity?","authors":["Sahil Joshi","Prithvi Dixit","Agniva Chowdhury","Anshumali Shrivastava","Joseph E. Gonzalez","Ion Stoica","Kumar Krishna Agrawal","Aditya Desai"],"arxiv_id":"2605.24168v1","link":"http://arxiv.org/abs/2605.24168v1","published":"2026-05-22T19:38:23Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1539,"ts_score":1539,"ts_sigma":2.163113023961694,"ci":43.0,"wilson_margin":14.7,"win_rate":80.8,"wins":21,"losses":5,"comparisons":26,"ai_rating":6.8,"gap_score":14.3},{"id":"64e081aa-0055-4800-81d3-f93daed35581","rank":163,"title":"When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models","authors":["Josef Chen"],"arxiv_id":"2606.27288v1","link":"http://arxiv.org/abs/2606.27288v1","published":"2026-06-25T17:06:06Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1539,"ts_score":1539,"ts_sigma":2.2006817279433557,"ci":44.0,"wilson_margin":12.4,"win_rate":84.4,"wins":27,"losses":5,"comparisons":32,"ai_rating":7.5,"gap_score":-0.5},{"id":"557f8b18-1c0c-4d2d-885e-6d0152be0ad1","rank":164,"title":"AutoSynthesis: An agentic system for automated meta-analysis","authors":["Moein Taherinezhad","Sebastian Maier","Gerardo Vitagliano","Francesco Pierri","Stefan Feuerriegel"],"arxiv_id":"2607.15247v1","link":"http://arxiv.org/abs/2607.15247v1","published":"2026-07-16T17:45:27Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1539,"ts_score":1539,"ts_sigma":2.1858981051972783,"ci":44.0,"wilson_margin":15.6,"win_rate":81.8,"wins":18,"losses":4,"comparisons":22,"ai_rating":5.0,"gap_score":63.7},{"id":"46203db7-09e5-4a54-bb50-e2a86ea20a3c","rank":165,"title":"Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","authors":["Chi Zhang","Haibo Qiu","Qiming Zhang","Yufei Xu","Xinbo Gao","Jing Zhang"],"arxiv_id":"2605.11636v1","link":"http://arxiv.org/abs/2605.11636v1","published":"2026-05-12T06:58:35Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1539,"ts_score":1539,"ts_sigma":2.1707588669304716,"ci":43.0,"wilson_margin":15.1,"win_rate":82.6,"wins":19,"losses":4,"comparisons":23,"ai_rating":7.8,"gap_score":-2.1},{"id":"2f4eb2ae-04d4-4d46-82f4-ac1594864e73","rank":166,"title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","authors":["Tianle Wang","Zhaoyang Wang","Guangchen Lan","Xinpeng Wei","Sipeng Zhang","Guanwen Qiu","Abulhair Saparov"],"arxiv_id":"2605.06638v1","link":"http://arxiv.org/abs/2605.06638v1","published":"2026-05-07T17:48:42Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1539,"ts_score":1539,"ts_sigma":2.1392945089126325,"ci":43.0,"wilson_margin":12.9,"win_rate":85.7,"wins":24,"losses":4,"comparisons":28,"ai_rating":7.5,"gap_score":-0.5},{"id":"20b03376-b701-4cde-96b2-8c0193b1c1d8","rank":167,"title":"Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs","authors":["Zhe Yu","Wenpeng Xing","Chen Ye","Xuyang Teng","Bo Yang","Changting Lin","Meng Han"],"arxiv_id":"2605.27157v1","link":"http://arxiv.org/abs/2605.27157v1","published":"2026-05-26T15:18:43Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1539,"ts_score":1539,"ts_sigma":2.175955709349554,"ci":44.0,"wilson_margin":12.5,"win_rate":86.2,"wins":25,"losses":4,"comparisons":29,"ai_rating":5.5,"gap_score":53.8},{"id":"14fb3259-cf93-4e94-ae2b-baa339c4f5c4","rank":168,"title":"Can AI Agents Synthesize Scientific Conclusions?","authors":["Hayoung Jung","Pedro Viana Diniz","José Reinaldo Corrêa Roveda","Abner Fernandes da Silva","Haeun Jung","Enoch Tsai","Aleksandra Korolova","Manoel Horta Ribeiro"],"arxiv_id":"2606.11337v1","link":"http://arxiv.org/abs/2606.11337v1","published":"2026-06-09T18:16:04Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.CY"],"score":1539,"ts_score":1539,"ts_sigma":2.1466132251440704,"ci":43.0,"wilson_margin":14.1,"win_rate":84.0,"wins":21,"losses":4,"comparisons":25,"ai_rating":8.0,"gap_score":-3.0},{"id":"08f951fb-c755-48c9-a4dc-c90ada88d102","rank":169,"title":"Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction","authors":["Jiahe Guo","Xiangran Guo","Jiaxuan Chen","Weixiang Zhao","Yanyan Zhao","Yutai Hou","Qianchao Wang","Dandan Tu"],"arxiv_id":"2605.18104v1","link":"http://arxiv.org/abs/2605.18104v1","published":"2026-05-18T09:16:55Z","primary_category":"cs.AI","categories":["cs.AI","cs.CR"],"score":1539,"ts_score":1539,"ts_sigma":2.133446199391133,"ci":43.0,"wilson_margin":12.9,"win_rate":85.7,"wins":24,"losses":4,"comparisons":28,"ai_rating":7.2,"gap_score":3.9},{"id":"f8374617-c92f-4742-9a41-ef405cc3b837","rank":170,"title":"JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR","authors":["Xinjie Chen","Biao Fu","Jing Wu","Guoxin Chen","Xinggao Liu","Dayiheng Liu","Minpeng Liao"],"arxiv_id":"2604.25419v1","link":"http://arxiv.org/abs/2604.25419v1","published":"2026-04-28T09:29:00Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1538,"ts_score":1538,"ts_sigma":1.6955772396957474,"ci":34.0,"wilson_margin":14.4,"win_rate":58.5,"wins":24,"losses":17,"comparisons":41,"ai_rating":6.8,"gap_score":14.2},{"id":"f7579df7-3e14-441c-8cfc-0a50ddd81d67","rank":171,"title":"Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF","authors":["Chinmayi Dixit"],"arxiv_id":"2607.10750v1","link":"http://arxiv.org/abs/2607.10750v1","published":"2026-07-12T13:00:41Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1538,"ts_score":1538,"ts_sigma":2.1379887336317243,"ci":43.0,"wilson_margin":17.2,"win_rate":76.2,"wins":16,"losses":5,"comparisons":21,"ai_rating":5.8,"gap_score":42.9},{"id":"c7b99c5d-f41d-4ca2-8379-422cbcc5aace","rank":172,"title":"LLM-Evolved Domain-Independent Heuristics for Symbolic AI Planning","authors":["Elliot Gestrin","Jendrik Seipp"],"arxiv_id":"2605.29649v1","link":"http://arxiv.org/abs/2605.29649v1","published":"2026-05-28T09:14:39Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1538,"ts_score":1538,"ts_sigma":2.1239670736751632,"ci":42.0,"wilson_margin":14.1,"win_rate":84.0,"wins":21,"losses":4,"comparisons":25,"ai_rating":7.8,"gap_score":-2.2},{"id":"50a460d7-983c-4c5d-bd25-02ef6bd705d4","rank":173,"title":"Compress Then Adapt? No, Do It Together via Task-aware Union of Subspaces","authors":["Jingze Ge","Yun Liu","Xue Geng","Wanqi Dong","Wang Zhe Mark","Min Wu","Xulei Yang"],"arxiv_id":"2605.02829v1","link":"http://arxiv.org/abs/2605.02829v1","published":"2026-05-04T17:05:45Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1538,"ts_score":1538,"ts_sigma":1.2502265899468799,"ci":25.0,"wilson_margin":5.4,"win_rate":87.5,"wins":126,"losses":18,"comparisons":144,"ai_rating":7.2,"gap_score":3.7},{"id":"378795c0-516c-4022-a9c5-94089340600c","rank":174,"title":"MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning","authors":["Maria Nesterova","Mikhail Kolosov","Anton Andreychuk","Egor Cherepanov","Oleg Bulichev","Alexey Kovalev","Konstantin Yakovlev","Aleksandr Panov"],"arxiv_id":"2604.05943v1","link":"http://arxiv.org/abs/2604.05943v1","published":"2026-04-07T14:40:01Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1538,"ts_score":1538,"ts_sigma":0.9953561427567422,"ci":20.0,"wilson_margin":7.5,"win_rate":70.7,"wins":99,"losses":41,"comparisons":140,"ai_rating":5.5,"gap_score":53.7},{"id":"b5e848ee-358c-48cb-ac5a-cc4df2c2e465","rank":175,"title":"LLM Reasoning Is Latent, Not the Chain of Thought","authors":["Wenshuo Wang"],"arxiv_id":"2604.15726v1","link":"http://arxiv.org/abs/2604.15726v1","published":"2026-04-17T05:59:08Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1537,"ts_score":1537,"ts_sigma":1.2319498313024253,"ci":25.0,"wilson_margin":11.5,"win_rate":67.2,"wins":41,"losses":20,"comparisons":61,"ai_rating":5.8,"gap_score":42.8},{"id":"ae3adfd0-785b-46cd-b22f-040158373812","rank":176,"title":"Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models","authors":["Xinyu Lian","Walid Krichene","Beichen Huang","Masahiro Tanaka","Olatunji Ruwase","Li Zhang","Minjia Zhang"],"arxiv_id":"2606.25519v1","link":"http://arxiv.org/abs/2606.25519v1","published":"2026-06-24T07:54:55Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1537,"ts_score":1537,"ts_sigma":2.149579589425361,"ci":43.0,"wilson_margin":16.2,"win_rate":81.0,"wins":17,"losses":4,"comparisons":21,"ai_rating":6.5,"gap_score":23.6},{"id":"815f6b0f-ee92-4186-80e7-f9b9f3e5a90b","rank":177,"title":"Verifiable Process Rewards for Agentic Reasoning","authors":["Huining Yuan","Zelai Xu","Huaijie Wang","Xiangmin Yi","Jiaxuan Gao","Xiao-Ping Zhang","Yu Wang","Chao Yu"],"arxiv_id":"2605.10325v1","link":"http://arxiv.org/abs/2605.10325v1","published":"2026-05-11T10:30:53Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1537,"ts_score":1537,"ts_sigma":2.1843203335404646,"ci":44.0,"wilson_margin":14.3,"win_rate":86.4,"wins":19,"losses":3,"comparisons":22,"ai_rating":5.5,"gap_score":53.5},{"id":"505bbd08-48c4-4c09-a3b9-e9f65e81007a","rank":178,"title":"Attributing Emergence in Million-Agent Systems","authors":["Ling Tang","Jilin Mei","Qian Chen","Qihan Ren","Linfeng Zhang","Quanshi Zhang","Jing Shao","Xia Hu"],"arxiv_id":"2605.11404v1","link":"http://arxiv.org/abs/2605.11404v1","published":"2026-05-12T01:49:41Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1537,"ts_score":1537,"ts_sigma":2.14996550313357,"ci":43.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":6.5,"gap_score":23.6},{"id":"4656c148-629e-4fb9-8476-2795e84eeb3b","rank":179,"title":"Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs","authors":["Gabriel Poesia","Simon Henniger","Tzu-Han Hsu","Yilun Du","Nada Amin"],"arxiv_id":"2607.04631v1","link":"http://arxiv.org/abs/2607.04631v1","published":"2026-07-06T03:31:14Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1537,"ts_score":1537,"ts_sigma":2.1768548993419397,"ci":44.0,"wilson_margin":15.1,"win_rate":80.0,"wins":20,"losses":5,"comparisons":25,"ai_rating":7.0,"gap_score":7.9},{"id":"3787290d-9964-45d7-8d94-693ad08f391f","rank":180,"title":"Agentick: A Unified Benchmark for General Sequential Decision-Making Agents","authors":["Roger Creus Castanyer","Pablo Samuel Castro","Glen Berseth"],"arxiv_id":"2605.06869v1","link":"http://arxiv.org/abs/2605.06869v1","published":"2026-05-07T19:12:03Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1537,"ts_score":1537,"ts_sigma":2.1385830257249068,"ci":43.0,"wilson_margin":13.7,"win_rate":90.0,"wins":18,"losses":2,"comparisons":20,"ai_rating":6.2,"gap_score":32.7},{"id":"03266d70-bedc-4484-aef2-8182bad5194f","rank":181,"title":"GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents","authors":["Johannes Moll","Jean-Philippe Corbeil","Jiazhen Pan","Martin Hadamitzky","Daniel Rueckert","Lisa Adams","Keno Bressem"],"arxiv_id":"2605.29668v1","link":"http://arxiv.org/abs/2605.29668v1","published":"2026-05-28T09:30:09Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1537,"ts_score":1537,"ts_sigma":2.178017541819969,"ci":44.0,"wilson_margin":15.6,"win_rate":81.8,"wins":18,"losses":4,"comparisons":22,"ai_rating":7.2,"gap_score":3.6},{"id":"e5d350e0-e41d-4154-96d1-5177ca16dfd3","rank":182,"title":"Process Matters more than Output for Distinguishing Humans from Machines","authors":["Milena Rmus","Mathew D. Hardy","Thomas L. Griffiths","Mayank Agrawal"],"arxiv_id":"2605.06524v1","link":"http://arxiv.org/abs/2605.06524v1","published":"2026-05-07T16:30:35Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1536,"ts_score":1536,"ts_sigma":2.1510268155037626,"ci":43.0,"wilson_margin":13.3,"win_rate":85.2,"wins":23,"losses":4,"comparisons":27,"ai_rating":6.8,"gap_score":13.9},{"id":"aaa4821c-0194-4c5d-bd80-57690dafb709","rank":183,"title":"PassNet: Scaling Large Language Models for Graph Compiler Pass Generation","authors":["Yiqun Liu","Yingsheng Wu","Ruqi Yang","Enrong Zheng","Honglei Qiu","Sijun He","Tai Liang","Jingjing Wu"],"arxiv_id":"2605.29357v1","link":"http://arxiv.org/abs/2605.29357v1","published":"2026-05-28T04:55:14Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG","cs.PL"],"score":1536,"ts_score":1536,"ts_sigma":2.174881901963262,"ci":43.0,"wilson_margin":13.7,"win_rate":90.0,"wins":18,"losses":2,"comparisons":20,"ai_rating":6.8,"gap_score":13.9},{"id":"619eb036-5542-4aa2-ad9d-5781ab9dd093","rank":184,"title":"ASH: Agents that Self-Hone via Embodied Learning","authors":["Benjamin Schneider","Xavier Schneider","Victor Zhong","Sun Sun"],"arxiv_id":"2605.14211v1","link":"http://arxiv.org/abs/2605.14211v1","published":"2026-05-14T00:10:12Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1536,"ts_score":1536,"ts_sigma":2.136894671803811,"ci":43.0,"wilson_margin":14.8,"win_rate":85.7,"wins":18,"losses":3,"comparisons":21,"ai_rating":7.2,"gap_score":3.5},{"id":"e06560ae-4c37-4699-81db-e446ecd73ac9","rank":185,"title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","authors":["Jacky Kwok","Shulu Li","Pranav Atreya","Yuejiang Liu","Yixing Jiang","Chelsea Finn","Marco Pavone","Ion Stoica"],"arxiv_id":"2607.05391v2","link":"http://arxiv.org/abs/2607.05391v2","published":"2026-07-06T17:59:35Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG","cs.MA","cs.RO"],"score":1535,"ts_score":1535,"ts_sigma":2.1533501515675257,"ci":43.0,"wilson_margin":12.1,"win_rate":88.9,"wins":24,"losses":3,"comparisons":27,"ai_rating":7.2,"gap_score":3.4,"current_version":2},{"id":"96137939-6fad-4d81-9f79-50b837c37371","rank":186,"title":"Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery","authors":["Xinzhe Yuan","Zhuo Chen","Jianshu Zhang","Huan Xiong","Nanyang Ye","Yuqiang Li","Qinying Gu"],"arxiv_id":"2605.17976v1","link":"http://arxiv.org/abs/2605.17976v1","published":"2026-05-18T07:30:25Z","primary_category":"cs.AI","categories":["cs.AI","math.OC"],"score":1535,"ts_score":1535,"ts_sigma":2.1098444515450314,"ci":42.0,"wilson_margin":16.2,"win_rate":81.0,"wins":17,"losses":4,"comparisons":21,"ai_rating":7.2,"gap_score":3.4},{"id":"82eb2710-a941-437f-8ee8-ed0ac238c26b","rank":187,"title":"The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?","authors":["Zhaoyang Zhang","Run Shao","Dongyue Wu","Jiajie Teng","Chao Tao","Jingdong Chen","Haifeng Li"],"arxiv_id":"2605.09352v1","link":"http://arxiv.org/abs/2605.09352v1","published":"2026-05-10T06:05:04Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1535,"ts_score":1535,"ts_sigma":2.1997735330577637,"ci":44.0,"wilson_margin":14.8,"win_rate":85.7,"wins":18,"losses":3,"comparisons":21,"ai_rating":7.0,"gap_score":7.7},{"id":"2ab939e4-ba75-4a0b-9ce9-3911c9e01b40","rank":188,"title":"The Faithfulness Gap: Certifying Semantic Equivalence Between Natural-Language and Formal Mathematical Statements","authors":["Noor Islam S. Mohammad","Tamim Sheikh"],"arxiv_id":"2606.16541v1","link":"http://arxiv.org/abs/2606.16541v1","published":"2026-06-15T10:45:59Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1535,"ts_score":1535,"ts_sigma":1.8189863170761533,"ci":36.0,"wilson_margin":14.5,"win_rate":67.6,"wins":25,"losses":12,"comparisons":37,"ai_rating":7.2,"gap_score":3.4},{"id":"245474f4-18d6-4cf8-b649-17a2f1afc2ec","rank":189,"title":"SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning","authors":["Tianshi Zheng","Rui Wang","Xiyun Li","Yangqiu Song","Tianqing Fang"],"arxiv_id":"2605.01489v1","link":"http://arxiv.org/abs/2605.01489v1","published":"2026-05-02T15:26:45Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1535,"ts_score":1535,"ts_sigma":1.4502611535565788,"ci":29.0,"wilson_margin":9.4,"win_rate":74.1,"wins":60,"losses":21,"comparisons":81,"ai_rating":6.3,"gap_score":29.6},{"id":"146e0236-cab3-4bb0-a80c-90bd0ccca2d1","rank":190,"title":"AI advice suppresses people's willingness to say \"I don't know\", even when the advice is wrong and accuracy is incentivized","authors":["Chiara Marcoccia","Walter Quattrociocchi","Valerio Capraro"],"arxiv_id":"2607.13562v1","link":"http://arxiv.org/abs/2607.13562v1","published":"2026-07-15T08:04:14Z","primary_category":"cs.AI","categories":["cs.AI","cs.CY","cs.HC"],"score":1535,"ts_score":1535,"ts_sigma":2.1326110116507193,"ci":43.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":6.5,"gap_score":23.4},{"id":"1431b73f-4719-4b6c-82db-6a74d0ecbd52","rank":191,"title":"ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning","authors":["Shuaiyu Zhou","Fengpeng Yue","Zengjie Hu","Yuanzhe Shen","Chenyang Zhang","feng hong","Cao Liu","Ke Zeng"],"arxiv_id":"2607.15660v1","link":"http://arxiv.org/abs/2607.15660v1","published":"2026-07-17T06:12:04Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1535,"ts_score":1535,"ts_sigma":2.169174529722111,"ci":43.0,"wilson_margin":18.5,"win_rate":73.7,"wins":14,"losses":5,"comparisons":19,"ai_rating":5.5,"gap_score":53.3},{"id":"f6f418f9-d599-47a4-a819-3e9ed866e456","rank":192,"title":"Neuro-Inspired Inverse Learning for Planning and Control","authors":["Maryna Kapitonova","Tonio Ball"],"arxiv_id":"2605.24152v1","link":"http://arxiv.org/abs/2605.24152v1","published":"2026-05-22T19:19:32Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1534,"ts_score":1534,"ts_sigma":2.140378138270637,"ci":43.0,"wilson_margin":18.1,"win_rate":71.4,"wins":15,"losses":6,"comparisons":21,"ai_rating":6.8,"gap_score":13.6},{"id":"a272ccdf-dcce-4ee9-8f51-2cd7214263c7","rank":193,"title":"Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs","authors":["Xiaozhe Li","Xinyu Fang","Shengyuan Ding","Yang Li","Linyang Li","Haodong Duan","Qingwen Liu","Kai Chen"],"arxiv_id":"2605.08905v1","link":"http://arxiv.org/abs/2605.08905v1","published":"2026-05-09T11:57:25Z","primary_category":"cs.AI","categories":["cs.AI"],"score":1534,"ts_score":1534,"ts_sigma":2.150261709548624,"ci":43.0,"wilson_margin":13.8,"win_rate":87.0,"wins":20,"losses":3,"comparisons":23,"ai_rating":6.5,"gap_score":23.2},{"id":"93a41958-4df7-4a5c-b61a-c36c3124843d","rank":194,"title":"CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents","authors":["Bowen Wang","Dunjie Lu","Junli Wang","Tianyi Bai","Shixuan Liu","Zhipeng Zhang","Haiquan Wang","Hao Hu"],"arxiv_id":"2605.25624v1","link":"http://arxiv.org/abs/2605.25624v1","published":"2026-05-25T09:28:03Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1534,"ts_score":1534,"ts_sigma":2.1671036988877446,"ci":43.0,"wilson_margin":13.3,"win_rate":87.5,"wins":21,"losses":3,"comparisons":24,"ai_rating":7.5,"gap_score":-1.2},{"id":"8a25cb3d-47dd-44b4-9abc-6682de91ea86","rank":195,"title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","authors":["Mingkai Deng","Jinyu Hou","Lara Sá Neves","Varad Pimpalkhute","Taylor W. Killian","Zhengzhong Liu","Eric P. Xing"],"arxiv_id":"2605.22138v1","link":"http://arxiv.org/abs/2605.22138v1","published":"2026-05-21T08:11:54Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL","cs.LG","cs.RO"],"score":1534,"ts_score":1534,"ts_sigma":2.202391378964259,"ci":44.0,"wilson_margin":12.5,"win_rate":88.5,"wins":23,"losses":3,"comparisons":26,"ai_rating":7.2,"gap_score":3.2},{"id":"6be9d55b-fc54-4747-b415-c7a7b1e4c5cb","rank":196,"title":"The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?","authors":["Xinyu Lu","Tianshu Wang","Pengbo Wang","zujie wen","Zhiqiang Zhang","Jun Zhou","Boxi Cao","Yaojie Lu"],"arxiv_id":"2606.04455v1","link":"https://arxiv.org/abs/2606.04455","published":"2026-06-03T04:58:17Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1534,"ts_score":1534,"ts_sigma":2.1467517080660983,"ci":43.0,"wilson_margin":18.5,"win_rate":73.7,"wins":14,"losses":5,"comparisons":19,"ai_rating":6.8,"gap_score":13.6},{"id":"6371a565-67dd-46d5-a3a5-0e91134921e1","rank":197,"title":"Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents","authors":["Ahmad Al-Tawaha","Shangding Gu","Peizhi Niu","Ruoxi Jia","Ming Jin"],"arxiv_id":"2605.17830v1","link":"http://arxiv.org/abs/2605.17830v1","published":"2026-05-18T04:06:34Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1534,"ts_score":1534,"ts_sigma":2.1802937443175354,"ci":44.0,"wilson_margin":15.1,"win_rate":80.0,"wins":20,"losses":5,"comparisons":25,"ai_rating":7.3,"gap_score":0.6},{"id":"6062f990-5e71-4457-a341-c2570517f7cf","rank":198,"title":"Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation","authors":["Jinkun Liu","Haohan Chi","Lingfeng Zhang","Yifan Xie","YuAn Wang","Long Chen","Hangjun Ye","Xiaoshuai Hao"],"arxiv_id":"2605.00438v1","link":"http://arxiv.org/abs/2605.00438v1","published":"2026-05-01T06:15:43Z","primary_category":"cs.AI","categories":["cs.AI","cs.RO"],"score":1534,"ts_score":1534,"ts_sigma":1.6346287104647694,"ci":33.0,"wilson_margin":13.9,"win_rate":71.1,"wins":27,"losses":11,"comparisons":38,"ai_rating":6.8,"gap_score":13.6},{"id":"34538830-4df0-4755-9a0f-ef06c77b936f","rank":199,"title":"SkillOpt: Executive Strategy for Self-Evolving Agent Skills","authors":["Yifan Yang","Ziyang Gong","Weiquan Huang","Qihao Yang","Ziwei Zhou","Zisu Huang","Yan Li","Xuemei Gao"],"arxiv_id":"2605.23904v2","link":"http://arxiv.org/abs/2605.23904v2","published":"2026-05-22T17:59:50Z","primary_category":"cs.AI","categories":["cs.AI","cs.CL"],"score":1534,"ts_score":1534,"ts_sigma":2.1630779406903993,"ci":43.0,"wilson_margin":14.7,"win_rate":80.8,"wins":21,"losses":5,"comparisons":26,"ai_rating":7.5,"gap_score":-1.2,"current_version":2},{"id":"32764fa8-12b1-45e7-bb26-187377bec7ed","rank":200,"title":"Latent Thought Flow: Efficient Latent Reasoning in Large Language Models","authors":["Xiandong Zou","Jing Huang","Jianshu Li","Pan Zhou"],"arxiv_id":"2606.16222v1","link":"http://arxiv.org/abs/2606.16222v1","published":"2026-06-15T05:02:46Z","primary_category":"cs.AI","categories":["cs.AI","cs.LG"],"score":1534,"ts_score":1534,"ts_sigma":2.181734472086891,"ci":44.0,"wilson_margin":15.6,"win_rate":79.2,"wins":19,"losses":5,"comparisons":24,"ai_rating":6.8,"gap_score":13.6}],"total_papers":6126,"total_in_period":6006,"total_matches":79833,"is_ranking":false,"period":"all","category":"cs.AI","tags":null,"tag_mode":null,"warming_up":false,"community_correlation":null,"show_rating_column":true,"show_gap_column":true,"archives":[{"category":"cs.AI","period_type":"weekly","year":2026,"week":35,"month":null,"label":"Week 35, 2026","paper_count":195,"match_count":0},{"category":"cs.AI","period_type":"weekly","year":2026,"week":34,"month":null,"label":"Week 34, 2026","paper_count":196,"match_count":0},{"category":"cs.AI","period_type":"weekly","year":2026,"week":33,"month":null,"label":"Week 33, 2026","paper_count":192,"match_count":0},{"category":"cs.AI","period_type":"weekly","year":2026,"week":32,"month":null,"label":"Week 32, 2026","paper_count":188,"match_count":0},{"category":"cs.AI","period_type":"weekly","year":2026,"week":31,"month":null,"label":"Week 31, 2026","paper_count":179,"match_count":414},{"category":"cs.AI","period_type":"weekly","year":2026,"week":30,"month":null,"label":"Week 30, 2026","paper_count":161,"match_count":1624},{"category":"cs.AI","period_type":"weekly","year":2026,"week":29,"month":null,"label":"Week 29, 2026","paper_count":165,"match_count":1687},{"category":"cs.AI","period_type":"weekly","year":2026,"week":28,"month":null,"label":"Week 28, 2026","paper_count":158,"match_count":1588},{"category":"cs.AI","period_type":"weekly","year":2026,"week":27,"month":null,"label":"Week 27, 2026","paper_count":127,"match_count":1272},{"category":"cs.AI","period_type":"weekly","year":2026,"week":26,"month":null,"label":"Week 26, 2026","paper_count":177,"match_count":1879},{"category":"cs.AI","period_type":"weekly","year":2026,"week":25,"month":null,"label":"Week 25, 2026","paper_count":178,"match_count":1816},{"category":"cs.AI","period_type":"weekly","year":2026,"week":24,"month":null,"label":"Week 24, 2026","paper_count":183,"match_count":1876},{"category":"cs.AI","period_type":"weekly","year":2026,"week":23,"month":null,"label":"Week 23, 2026","paper_count":299,"match_count":3013},{"category":"cs.AI","period_type":"weekly","year":2026,"week":22,"month":null,"label":"Week 22, 2026","paper_count":402,"match_count":4199},{"category":"cs.AI","period_type":"weekly","year":2026,"week":21,"month":null,"label":"Week 21, 2026","paper_count":230,"match_count":2391},{"category":"cs.AI","period_type":"weekly","year":2026,"week":20,"month":null,"label":"Week 20, 2026","paper_count":355,"match_count":5380},{"category":"cs.AI","period_type":"weekly","year":2026,"week":19,"month":null,"label":"Week 19, 2026","paper_count":273,"match_count":4285},{"week":18,"year":2026,"month":null,"category":"cs.AI","period_type":"weekly","label":"Week 18, 2026","match_count":5548,"paper_count":274},{"period_type":"weekly","month":null,"week":17,"year":2026,"category":"cs.AI","label":"Week 17, 2026","match_count":3936,"paper_count":203},{"month":null,"period_type":"weekly","week":16,"year":2026,"category":"cs.AI","label":"Week 16, 2026","match_count":4336,"paper_count":196},{"month":null,"period_type":"weekly","week":15,"year":2026,"category":"cs.AI","label":"Week 15, 2026","match_count":5840,"paper_count":161}],"next_cursor":"eyJzIjoxNTM0LCJwIjoiMzI3NjRmYTgtMTJiMS00NWU3LWJiMjYtMTg3Mzc3YmVjN2VkIn0"}