10:13 Can AI Agents Automate LLM Post-Training? PostTrainBench Results | Maksym Andriushchenko 519 views • 1 week ago
9:10 Measuring AI R&D Automation: What Happens When AI Automates AI Research | Alan Chan (GovAI) 441 views • 1 week ago
10:05 Can We Predict AI Loss of Control? Trustworthy AI in the Age of Agents | Yinpeng Dong 227 views • 2 weeks ago
53:01 The Strategy for Solving Neglected AI Problems | Evan Miyazono (Atlas Computing) 282 views • 3 weeks ago
50:00 Making Safe AI Profitable: Standards, Audits, and Insurance | Sam Stowers (AIUC) 267 views • 3 weeks ago
54:09 The Two Cultures of AI Safety: Catastrophists vs Uniformitarians | Jesse Hoogland (Timaeus) 2.0K views • 3 weeks ago
5:11 Is Your AI Model Actually Secure? The Jailbreak Problem | Adam Gleave (FAR.AI) 135 views • 4 weeks ago
13:51 The Role Of Neural Geometry In Interpretability | Atticus Geiger (Goodfire) 794 views • 4 weeks ago
11:38 AI Is Already Deceptive: Detecting & Preventing AI Deception | Chris Cundy (FAR.AI) 211 views • 1 month ago
10:26 Alignment Faking: When AI Acts Safe Only Because It Knows It's Being Tested | Lu Wang 190 views • 1 month ago
10:39 Inside Alibaba's AI Model Spec: Defining AI Values, Safety & Behavior | Jiayu Shen (Alibaba) 181 views • 1 month ago
1:00:54 Is Global AI Safety Converging? AI Governance in the UK, EU & Korea | Panel (Alignment Workshop) 175 views • 1 month ago
5:50 Resolution: Scale and Automation for Higher Confidence in Alignment | Jesse Hoogland (Resolution) 184 views • 1 month ago
4:47 Why AI Safety Evaluations Are Broken: The Test-Time Compute Problem | Noam Brown (OpenAI) 1.5K views • 1 month ago
4:55 Mitigating Power Concentration and Multi-Agent Risks in AI | Samuel Simko (EuroSafeAI) 143 views • 1 month ago
4:53 Red-Teaming & Jailbreaking AI: Why Open-Weight Models Stay Vulnerable | Kellin Pelrine (FAR.AI) 176 views • 1 month ago
5:50 Making Open-Weight AI Safer by Filtering Training Data | Stella Biderman (EleutherAI) 218 views • 1 month ago
5:19 When AI Exceeds Human Experts: Measuring Superhuman AI Capabilities | Samira Nedungadi (SecureBio) 151 views • 1 month ago
4:35 AI Agent Safety: Can We Automate AI Safety? | Changyi Li (AutoControl Arena) 64 views • 1 month ago
5:05 Scientist AI: A Safe-by-Design Alternative to Agentic AI | Iulian Serban (LawZero) 151 views • 1 month ago
5:42 How Chinese Models Took Over Open-Source AI | Irene Solaiman (Hugging Face) 407 views • 1 month ago
48:09 FAR Seminar: Jamie Chou & Graeme Finley – AI Assurance: Infrastructure for Verifiable AI Deployment 97 views • 1 month ago
16:03 Stephen Casper - Non-Consensual AI Deepfakes: AI Safety's Trial by Fire 365 views • 4 months ago
44:24 Anne Neuberger - Fireside Chat with Anne Neuberger: AI and National Security [Alignment Workshop] 668 views • 5 months ago
13:23 Dominic Rizzo - Silicon Roots of Trust: Attestation You'd Want Even If Nobody Required It 312 views • 5 months ago
10:06 Christopher Summerfield - Lessons from a Chimp: AI "Scheming" & the Quest for Ape Language [Alignmen 368 views • 5 months ago