[Papers]

Research papers and publications from Scale Labs covering AI evaluation, safety, benchmarking, and frontier model analysis.

Date Title
9/4/2026
READY or Not: Reliable Enterprise Agent DeploymentAgents, Enterprise
8/20/2026
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHREvaluation and Alignment
8/6/2026
HarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAgents, Enterprise, Evaluation and Alignment
6/30/2026
DrugDiscoveryBench: Can Coding Agents Assist Early-Stage Drug Discovery?Agents, Enterprise, Evaluation and Alignment
6/29/2026
SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding SessionsAgents, Evaluation and Alignment
6/19/2026
ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld TasksAgents, Evaluation and Alignment
6/10/2026
Rubric-Guided Self-Distillation: Post-Training Without Rubric VerifiersPost-Training
6/9/2026
PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event TriageEvaluation and Alignment, Agents, Enterprise
6/4/2026
Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM AgentsAgents, Evaluation and Alignment, Enterprise
5/29/2026
ARCA: Adapter-Residual Credit Assignment When Token Signals DegeneratePost-Training, Reasoning
5/19/2026
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVRPost-Training, Reasoning
5/17/2026
ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM AgentsSafety & Oversight, Agents, Evaluation and Alignment
5/13/2026
ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety
5/12/2026
Reward Hacking in Rubric-Based Reinforcement LearningSafety & Oversight, Post-Training
5/7/2026
SWE Atlas: Benchmarking Coding Agents Beyond Issue ResolutionEvaluation and Alignment, Agents
4/22/2026
Coverage, Not Averages: Semantic Stratification for Trustworthy Retrieval EvaluationEvaluation and Alignment, Science of Data, Enterprise
4/13/2026
HiL-BENCH (Human-in-Loop Benchmark)Evaluation and Alignment, Safety & Oversight
3/12/2026
Defensive Refusal Bias: How Safety Alignment Fails Cyber DefendersSafety & Oversight
2/26/2026
LLM Novice Uplift on Dual-Use, In Silico Biology TasksSafety & Oversight
2/25/2026
VeRO: An Evaluation Harness for Agents to Optimize AgentsAgents, Post-Training, Evaluation and Alignment
2/12/2026
LHAW: Controllable Underspecification for Long-Horizon TasksAgents, Safety & Oversight, Evaluation and Alignment
1/15/2026
SciPredict: Can LLMs Predict the Outcomes of Research Experiments in Natural Sciences?Safety & Oversight, Evaluation and Alignment
1/6/2026
Agentic Rubrics as Contextual Verifiers for SWE AgentsAgents, Safety & Oversight, Evaluation and Alignment
12/22/2025
MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than OutcomesReasoning, Safety & Oversight, Evaluation and Alignment
12/18/2025
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP ServersAgents, Reasoning, Safety & Oversight, Evaluation and Alignment
12/17/2025
Audio MultiChallengeMultimodal, Safety & Oversight, Evaluation and Alignment
12/16/2025
Imitation Learning for Multi-turn LM Agents via On-Policy Expert CorrectionsPost-Training, Agents
11/25/2025
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic ApproachSafety & Oversight, Evaluation and Alignment
11/13/2025
Professional Reasoning BenchSafety & Oversight, Evaluation and Alignment, Reasoning
11/10/2025
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research AgentsReasoning, Safety & Oversight, Evaluation and Alignment
11/5/2025
Best Practices for Biorisk Evaluations on Open-Weight Bio-Foundation ModelsSafety & Oversight, Evaluation and Alignment
10/28/2025
Remote Labor Index: Measuring AI Automation of Remote WorkAgents, Safety & Oversight, Evaluation and Alignment, Reasoning
10/20/2025
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable RewardsReasoning, Agents, Safety & Oversight, Evaluation and Alignment
10/15/2025
Beyond Seeing: Evaluating Multimodal LLMs On Tool-enabled Image Perception, Transformation, and ReasoningSafety & Oversight, Evaluation and Alignment, Reasoning, Multimodal
10/8/2025
Online Rubrics Elicitation from Pairwise ComparisonsSafety & Oversight, Evaluation and Alignment, Post-Training
9/25/2025
Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-TrainingPost-Training, Science of Data
9/23/2025
Progress over Points: Reframing LM Benchmarks Around Scientific ObjectivesSafety & Oversight, Evaluation and Alignment
9/19/2025
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?Agents, Safety & Oversight, Evaluation and Alignment
9/11/2025
TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language ModelsSafety & Oversight, Evaluation and Alignment
8/26/2025
Reliable Weak-to-Strong Monitoring of LLM AgentsSafety & Oversight, Evaluation and Alignment
8/13/2025
Search-Time Data ContaminationSafety & Oversight, Evaluation and Alignment
7/23/2025
MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMsReasoning, Safety & Oversight, Evaluation and Alignment
7/23/2025
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable DomainsScience of Data, Post-Training
7/21/2025
WebGuard: Building a Generalizable Guardrail for Web AgentsAgents, Safety & Oversight, Evaluation and Alignment
7/15/2025
Chain of Thought Monitorability: A New and Fragile Opportunity for AI SafetyReasoning, Safety & Oversight, Evaluation and Alignment
6/28/2025
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought ReasoningPost-Training, Reasoning
6/18/2025
FORTRESS: Frontier Risk Evaluation for National Security and Public SafetySafety & Oversight, Evaluation and Alignment
6/16/2025
Adaptive Guidance Accelerates Reinforcement Learning of Reasoning ModelsReasoning
6/13/2025
Agent-RLVR: Training Software Engineering Agents via Guidance and Environment RewardsAgents, Post-Training, Reasoning
6/5/2025
A Red Teaming Roadmap Towards System-Level SafetySafety & Oversight, Evaluation and Alignment
5/9/2025
Assessing Robustness to Spurious Correlations in Post-Training Language ModelsPost-Training, Science of Data
3/14/2025
Relevance Isn't All You Need: Scaling RAG Systems With Inference-Time Compute Via Multi-Criteria RerankingReasoning
3/8/2025
Critical Foreign Policy Decisions (CFPD)-Benchmark: Measuring Diplomatic Preferences in Large Language ModelsSafety & Oversight, Evaluation and Alignment
3/5/2025
The MASK Benchmark: Disentangling Honesty From Accuracy in AI SystemsSafety & Oversight, Evaluation and Alignment
2/13/2025
ENIGMAEVAL: A Benchmark of Long Multimodal Reasoning ChallengesReasoning, Safety & Oversight, Evaluation and Alignment
2/11/2025
J2: Jailbreaking to JailbreakSafety & Oversight, Evaluation and Alignment
2/10/2025
ProjectTest: A Project-level LLM Unit Test Generation Benchmark and Impact of Error Fixing MechanismsSafety & Oversight, Evaluation and Alignment
1/29/2025
MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMsSafety & Oversight, Evaluation and Alignment, Reasoning
1/23/2025
Humanity's Last ExamSafety & Oversight, Evaluation and Alignment, Reasoning
1/2/2025
ToolComp: A Multi-Tool Reasoning & Process Supervision BenchmarkSafety & Oversight, Evaluation and Alignment, Reasoning
10/11/2024
Refusal-Trained LLMs Are Easily Jailbroken As Browser AgentsSafety & Oversight, Evaluation and Alignment
9/29/2024
Balancing Cost and Effectiveness of Synthetic Data Generation Strategies for LLMsPost-Training, Science of Data
9/27/2024
Revisiting the Superficial Alignment HypothesisPost-Training
9/5/2024
Planning In Natural Language Improves LLM Search For Code GenerationPost-Training
8/30/2024
Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding DataSafety & Oversight, Evaluation and Alignment, Multimodal, Science of Data
8/27/2024
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks YetSafety & Oversight, Evaluation and Alignment
7/18/2024
Learning Goal-Conditioned Representations for Language Reward ModelsPost-Training
5/1/2024
A Careful Examination of Large Language Model Performance on Grade School ArithmeticSafety & Oversight, Evaluation and Alignment
3/5/2024
The WMDP Benchmark: Measuring and Reducing Malicious Use With UnlearningSafety & Oversight, Evaluation and Alignment, Post-Training
1/22/2024
Out-of-Distribution Detection & Applications With Ablated Learned Temperature EnergyComputer Vision
11/21/2023
A Baseline Analysis of Reward Models’ Ability To Accurately Analyze Foundation Models Under Distribution ShiftPost-Training
10/5/2023
A Holistic Approach For Test And Evaluation Of Large Language ModelsSafety & Oversight, Evaluation and Alignment
10/4/2023
On the Performance of Multimodal Language ModelsMultimodal, Post-Training
4/28/2023
Empirical Analysis of the Strengths and Weaknesses of PEFT Techniques for LLMsPost-Training
4/11/2023
Detecting and Preventing Hallucinations in Large Vision Language ModelsComputer Vision
3/11/2023
Enabling Calibration In The Zero-shot Inference Of Large Vision-Language ModelsComputer Vision
1/29/2023
Improving the Accuracy-Robustness Trade-Off of Classifiers via Adaptive SmoothingSafety & Oversight, Evaluation and Alignment
3/7/2022
GlideNet: Global, Local and Intrinsic based Dense Embedding NETwork for Multi-category Attributes PredictionComputer Vision
11/16/2021
CAR – Cityscapes Attributes Recognition A Multi-category Attributes Dataset for Autonomous VehiclesComputer Vision
11/7/2021
Natural Adversarial ObjectsComputer Vision
10/11/2021
DEBAGREEMENT: A comment-reply dataset for (dis)agreement detection in online debatesSafety & Oversight, Evaluation and Alignment
7/31/2021
On The State of Data In Computer Vision: Human Annotations Remain Indispensable for Developing Deep Learning ModelsComputer Vision, Science of Data
4/20/2021
Evaluating Deep Neural Networks Trained on Clinical Images in Dermatology with the Fitzpatrick 17k DatasetComputer Vision
11/27/2020
A Survey of Deep Learning Approaches for OCR and Document UnderstandingComputer Vision

84 papers found