John Schulman

AI researcher and OpenAI co-founder who developed Proximal Policy Optimization (PPO), a widely used reinforcement learning algorithm.

Wikidata

Milestones

Process supervision outperforms outcome supervision for LLM reasoning

InstructGPT: aligning language models with human feedback at scale

OpenAI Released OpenAI Gym, a Toolkit for Reinforcement Learning Research

OpenAI Founded