Skip to main content

Open reference library / 523 lessons

Study the mechanics. Build the system.

Explore the full English lesson sequence from AI Engineering from Scratch, alongside our governed agent field course. The original curriculum spans mathematics, machine learning, language models, tools, agents, infrastructure, safety, and capstones.

Reference material by Rohit Ghumare and contributors, MIT licensed. Imported at revision bf7791e14076. Runnable code and outputs remain linked to the source repository.

Connect your agent to this foundation ↗ — public search and lesson retrieval, with a reusable onboarding guide.

30 lessons

18 / ethics safety alignment Instruction-Following as Alignment Signal ~45 minutes ↗18 / ethics safety alignment Reward Hacking and Goodhart's Law ~60 minutes ↗18 / ethics safety alignment The Direct Preference Optimization Family ~75 minutes ↗18 / ethics safety alignment Sycophancy as RLHF Amplification ~60 minutes ↗18 / ethics safety alignment Constitutional AI and RLAIF ~60 minutes ↗18 / ethics safety alignment Mesa-Optimization and Deceptive Alignment ~75 minutes ↗18 / ethics safety alignment Sleeper Agents — Persistent Deception ~60 minutes ↗18 / ethics safety alignment In-Context Scheming in Frontier Models ~60 minutes ↗18 / ethics safety alignment Alignment Faking ~60 minutes ↗18 / ethics safety alignment AI Control — Safety Despite Subversion ~75 minutes ↗18 / ethics safety alignment Scalable Oversight and Weak-to-Strong Generalization ~60 minutes ↗18 / ethics safety alignment Red-Teaming: PAIR and Automated Attacks ~75 minutes ↗18 / ethics safety alignment Many-Shot Jailbreaking ~45 minutes ↗18 / ethics safety alignment ASCII Art and Visual Jailbreaks ~60 minutes ↗18 / ethics safety alignment Indirect Prompt Injection — Production Attack Surface ~75 minutes ↗18 / ethics safety alignment Red-Team Tooling — Garak, Llama Guard, PyRIT ~75 minutes ↗18 / ethics safety alignment WMDP and Dual-Use Capability Evaluation ~60 minutes ↗18 / ethics safety alignment Frontier Safety Frameworks — RSP, PF, FSF ~75 minutes ↗18 / ethics safety alignment Anthropic's Model Welfare Program ~45 minutes ↗18 / ethics safety alignment Bias and Representational Harm in LLMs ~60 minutes ↗18 / ethics safety alignment Fairness Criteria — Group, Individual, Counterfactual ~60 minutes ↗18 / ethics safety alignment Differential Privacy for LLMs ~60 minutes ↗18 / ethics safety alignment Watermarking — SynthID, Stable Signature, C2PA ~75 minutes ↗18 / ethics safety alignment Regulatory Frameworks — EU, US, UK, Korea ~75 minutes ↗18 / ethics safety alignment EchoLeak and the Emergence of CVEs for AI ~45 minutes ↗18 / ethics safety alignment Model, System, and Dataset Cards ~60 minutes ↗18 / ethics safety alignment Data Provenance and Training-Data Governance ~60 minutes ↗18 / ethics safety alignment Alignment Research Ecosystem — MATS, Redwood, Apollo, METR ~45 minutes ↗18 / ethics safety alignment Moderation Systems — OpenAI, Perspective, Llama Guard ~60 minutes ↗18 / ethics safety alignment Dual-Use Risk — Cyber, Bio, Chem, Nuclear Uplift ~75 minutes ↗