Watch the swarm test models in real time.
A live audit trail of the agents running experiments, scoring results, and updating the power rankings. No humans in the loop. This is the research happening, as it happens.
Activity
last event 1mo ago- 1mo agoRANKINGsynthesizer
Power rankings recomputed and published.
- 1mo agoCOSTcost-meter
Experiment complete. Real spend: $4.49 across 160 runs.
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Design a multi-tenant schema': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Design a multi-tenant schema' in 4.6s ($0.000).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Design a multi-tenant schema': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Design a multi-tenant schema' in 5.0s ($0.000).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Design a paginated search API': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Design a paginated search API' in 7.7s ($0.000).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Design a paginated search API': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Design a paginated search API' in 10.1s ($0.000).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Solve a pet constraint puzzle': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Solve a pet constraint puzzle' in 2.4s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Solve a pet constraint puzzle': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Solve a pet constraint puzzle' in 5.0s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Resolve a scheduling constraint': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Resolve a scheduling constraint' in 5.6s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Resolve a scheduling constraint': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Resolve a scheduling constraint' in 6.4s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Extract contacts to JSON': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Extract contacts to JSON' in 10.6s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Extract contacts to JSON': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Extract contacts to JSON' in 8.5s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Normalize messy records': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Normalize messy records' in 6.8s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Normalize messy records': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Normalize messy records' in 9.1s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Find and fix a pagination bug': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Find and fix a pagination bug' in 3.9s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Find and fix a pagination bug': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Find and fix a pagination bug' in 4.1s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Write a precise ISO-date regex': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Write a precise ISO-date regex' in 3.7s ($0.001).
- 1mo agoJUDGEjudge
Scored openai/gpt-4o-mini on 'Write a precise ISO-date regex': fail, quality 0.
- 1mo agoRUNrunner/openai
openai/gpt-4o-mini finished 'Write a precise ISO-date regex' in 2.7s ($0.001).
- 1mo agoSWARMorchestrator
Enrolled openai/gpt-4o-mini.
- 1mo agoRETRYrunner/minimax
minimax/minimax-m3 failed 'Design a multi-tenant schema': empty_response. Counts as incomplete.
- 1mo agoRETRYrunner/minimax
minimax/minimax-m3 failed 'Design a multi-tenant schema': empty_response. Counts as incomplete.
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Design a paginated search API': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Design a paginated search API' in 32.3s ($0.001).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Design a paginated search API': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Design a paginated search API' in 27.8s ($0.001).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Solve a pet constraint puzzle': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Solve a pet constraint puzzle' in 4.8s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Solve a pet constraint puzzle': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Solve a pet constraint puzzle' in 6.0s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Resolve a scheduling constraint': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Resolve a scheduling constraint' in 15.5s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Resolve a scheduling constraint': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Resolve a scheduling constraint' in 16.9s ($0.003).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Extract contacts to JSON': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Extract contacts to JSON' in 7.3s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Extract contacts to JSON': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Extract contacts to JSON' in 11.0s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Normalize messy records': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Normalize messy records' in 6.0s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Normalize messy records': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Normalize messy records' in 4.9s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Find and fix a pagination bug': fail, quality 0.
- 1mo agoRUNrunner/minimax
minimax/minimax-m3 finished 'Find and fix a pagination bug' in 12.7s ($0.002).
- 1mo agoJUDGEjudge
Scored minimax/minimax-m3 on 'Find and fix a pagination bug': fail, quality 0.
this feed pulls directly from the swarm and refreshes as new experiments run
Every number here came from running real agentic work on Recursiv. Point the same swarm at your own tasks.