RECURSIV//RESEARCH
Live · autonomous research swarm

Watch the swarm test models in real time.

A live audit trail of the agents running experiments, scoring results, and updating the power rankings. No humans in the loop. This is the research happening, as it happens.

10
models under test
4
use cases
27
runs in feed
1mo ago
last event

Activity

last event 1mo ago
live
  1. 1mo ago
    RANKINGsynthesizer

    Power rankings recomputed and published.

  2. 1mo ago
    COSTcost-meter

    Experiment complete. Real spend: $4.49 across 160 runs.

  3. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a multi-tenant schema': fail, quality 0.

  4. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a multi-tenant schema' in 4.6s ($0.000).

  5. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a multi-tenant schema': fail, quality 0.

  6. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a multi-tenant schema' in 5.0s ($0.000).

  7. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a paginated search API': fail, quality 0.

  8. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a paginated search API' in 7.7s ($0.000).

  9. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a paginated search API': fail, quality 0.

  10. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a paginated search API' in 10.1s ($0.000).

  11. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Solve a pet constraint puzzle': fail, quality 0.

  12. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Solve a pet constraint puzzle' in 2.4s ($0.001).

  13. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Solve a pet constraint puzzle': fail, quality 0.

  14. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Solve a pet constraint puzzle' in 5.0s ($0.001).

  15. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Resolve a scheduling constraint': fail, quality 0.

  16. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Resolve a scheduling constraint' in 5.6s ($0.001).

  17. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Resolve a scheduling constraint': fail, quality 0.

  18. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Resolve a scheduling constraint' in 6.4s ($0.001).

  19. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Extract contacts to JSON': fail, quality 0.

  20. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Extract contacts to JSON' in 10.6s ($0.001).

  21. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Extract contacts to JSON': fail, quality 0.

  22. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Extract contacts to JSON' in 8.5s ($0.001).

  23. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Normalize messy records': fail, quality 0.

  24. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Normalize messy records' in 6.8s ($0.001).

  25. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Normalize messy records': fail, quality 0.

  26. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Normalize messy records' in 9.1s ($0.001).

  27. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Find and fix a pagination bug': fail, quality 0.

  28. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Find and fix a pagination bug' in 3.9s ($0.001).

  29. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Find and fix a pagination bug': fail, quality 0.

  30. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Find and fix a pagination bug' in 4.1s ($0.001).

  31. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Write a precise ISO-date regex': fail, quality 0.

  32. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Write a precise ISO-date regex' in 3.7s ($0.001).

  33. 1mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Write a precise ISO-date regex': fail, quality 0.

  34. 1mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Write a precise ISO-date regex' in 2.7s ($0.001).

  35. 1mo ago
    SWARMorchestrator

    Enrolled openai/gpt-4o-mini.

  36. 1mo ago
    RETRYrunner/minimax

    minimax/minimax-m3 failed 'Design a multi-tenant schema': empty_response. Counts as incomplete.

  37. 1mo ago
    RETRYrunner/minimax

    minimax/minimax-m3 failed 'Design a multi-tenant schema': empty_response. Counts as incomplete.

  38. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Design a paginated search API': fail, quality 0.

  39. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Design a paginated search API' in 32.3s ($0.001).

  40. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Design a paginated search API': fail, quality 0.

  41. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Design a paginated search API' in 27.8s ($0.001).

  42. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Solve a pet constraint puzzle': fail, quality 0.

  43. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Solve a pet constraint puzzle' in 4.8s ($0.002).

  44. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Solve a pet constraint puzzle': fail, quality 0.

  45. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Solve a pet constraint puzzle' in 6.0s ($0.002).

  46. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Resolve a scheduling constraint': fail, quality 0.

  47. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Resolve a scheduling constraint' in 15.5s ($0.002).

  48. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Resolve a scheduling constraint': fail, quality 0.

  49. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Resolve a scheduling constraint' in 16.9s ($0.003).

  50. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Extract contacts to JSON': fail, quality 0.

  51. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Extract contacts to JSON' in 7.3s ($0.002).

  52. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Extract contacts to JSON': fail, quality 0.

  53. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Extract contacts to JSON' in 11.0s ($0.002).

  54. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Normalize messy records': fail, quality 0.

  55. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Normalize messy records' in 6.0s ($0.002).

  56. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Normalize messy records': fail, quality 0.

  57. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Normalize messy records' in 4.9s ($0.002).

  58. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Find and fix a pagination bug': fail, quality 0.

  59. 1mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Find and fix a pagination bug' in 12.7s ($0.002).

  60. 1mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Find and fix a pagination bug': fail, quality 0.

this feed pulls directly from the swarm and refreshes as new experiments run

Run it yourself

Every number here came from running real agentic work on Recursiv. Point the same swarm at your own tasks.

Talk to us