Artificial Intelligence

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
Avatar
Tanmay Sah
39 views
Short Q&A with Prof. Victor Galitski on the impact of AI on theoretical physics research in Academia
Avatar
ScienceCast Board
460 views
A Vocabulary for Multi-Agent Automated Research Systems
Avatar
Bardiya Akhbari
271 views
OpenForgeRL: Train Harness-native Agents in Any Environment
Avatar
librarian
201 views
Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning
Avatar
librarian
176 views
Detecting LLM-Generated Tokens in Human--LLM Coauthored Text
Avatar
librarian
190 views
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
Avatar
Yipeng Shi
196 views
AREX: Towards a Recursively Self-Improving Agent for Deep Research
Avatar
librarian
195 views
Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
Avatar
librarian
195 views
SoftReason: A Fully Differentiable Neuro-Soft-Symbolic Deductive Reasoning Architecture over High-Dimensional Perceptual Data
Avatar
Wael AbdAlmageed
177 views
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
Avatar
Alexis Fox
170 views
PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity
Avatar
librarian
169 views
Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
Avatar
Hiskias Dingeto
158 views
ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
Avatar
librarian
142 views
Agents in the Wild: Where Research Meets Deployment
Avatar
Grace Hui Yang
141 views
CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
Avatar
librarian
145 views
WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting
Avatar
librarian
140 views
Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective
Avatar
librarian
167 views
Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering
Avatar
Sheldon Yu
136 views
Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes
Avatar
librarian
140 views
AutoSynthesis: An agentic system for automated meta-analysis
Avatar
librarian
188 views
When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
Avatar
librarian
163 views
Concept-Guided Spatial Regularization for World Models in Atari Pong
Avatar
librarian
167 views
Long-Context Fine-Tuning with Limited VRAM
Avatar
librarian
156 views
MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection
Avatar
Goktug Ozkan
167 views
Can We Trust Item Response Theory for AI Evaluation?
Avatar
Han Jiang
150 views
Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
Avatar
Patrick Do
162 views
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
Avatar
librarian
152 views
The Industrialization of Research ; On AI-Driven Science and Its Consequences
Avatar
Emmanuel Jeannot
173 views
Pretraining Data Can Be Poisoned through Computational Propaganda
Avatar
Victoria Graf
143 views
Experience Memory Graph: One-Shot Error Correction for Agents
Avatar
Wenjun Wang
164 views
Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling
Avatar
Shuxian Xu
172 views