Cine este John Schulman
John Schulman este cercetător american în reinforcement learning, co-fondator OpenAI în decembrie 2015 (unul dintre cei 7 founders principali). Inventatorul Proximal Policy Optimization (PPO) — algoritmul de reinforcement learning folosit în RLHF pentru ChatGPT, Claude și aproape toate sistemele LLM moderne. A părăsit OpenAI în august 2024 pentru Anthropic, apoi a plecat din Anthropic în februarie 2025 pentru a se alătura Thinking Machines Lab (Mira Murati).
Întrebări frecvente
Cine este John Schulman? Co-fondator OpenAI (2015), inventator PPO. Trecere OpenAI → Anthropic (aug 2024) → Thinking Machines Lab (feb 2025).
Ce este PPO? Proximal Policy Optimization — algoritm de reinforcement learning publicat de Schulman 2017 la OpenAI. Folosit în RLHF pentru aliniere LLM.
De ce a plecat de la OpenAI? Plecare august 2024 după 9 ani la OpenAI. Motiv declarat: "more focus on AI alignment work". S-a alăturat Anthropic, apoi Thinking Machines.
Unde a studiat Schulman? PhD Computer Science UC Berkeley (2016, supervizor Pieter Abbeel). Anterior Caltech.