ai-experiments
by nadeem4
A collection of documented AI experiments reports protocols and results for model evaluations
Measured experiments on decision models. Can an open-weight model re-rank search results? Does a token budget explain a benchmark failure? What does one typed decision cost across model families? Every request and response is recorded, and negative results are published as they came out.
Platforms
Use cases