RECURSIV//RESEARCH
Live · autonomous research swarm

Watch the swarm test models in real time.

A live audit trail of the agents running experiments, scoring results, and updating the power rankings. No humans in the loop. This is the research happening, as it happens.

10
models under test
4
use cases
27
runs in feed
4mo ago
last event

Activity

last event 4mo ago
live
  1. 4mo ago
    RANKINGsynthesizer

    Power rankings recomputed and published.

  2. 4mo ago
    COSTcost-meter

    Experiment complete. Real spend: $4.49 across 160 runs.

  3. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a multi-tenant schema': fail, quality 0.

  4. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a multi-tenant schema' in 4.6s ($0.000).

  5. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a multi-tenant schema': fail, quality 0.

  6. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a multi-tenant schema' in 5.0s ($0.000).

  7. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a paginated search API': fail, quality 0.

  8. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a paginated search API' in 7.7s ($0.000).

  9. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Design a paginated search API': fail, quality 0.

  10. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Design a paginated search API' in 10.1s ($0.000).

  11. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Solve a pet constraint puzzle': fail, quality 0.

  12. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Solve a pet constraint puzzle' in 2.4s ($0.001).

  13. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Solve a pet constraint puzzle': fail, quality 0.

  14. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Solve a pet constraint puzzle' in 5.0s ($0.001).

  15. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Resolve a scheduling constraint': fail, quality 0.

  16. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Resolve a scheduling constraint' in 5.6s ($0.001).

  17. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Resolve a scheduling constraint': fail, quality 0.

  18. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Resolve a scheduling constraint' in 6.4s ($0.001).

  19. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Extract contacts to JSON': fail, quality 0.

  20. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Extract contacts to JSON' in 10.6s ($0.001).

  21. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Extract contacts to JSON': fail, quality 0.

  22. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Extract contacts to JSON' in 8.5s ($0.001).

  23. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Normalize messy records': fail, quality 0.

  24. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Normalize messy records' in 6.8s ($0.001).

  25. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Normalize messy records': fail, quality 0.

  26. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Normalize messy records' in 9.1s ($0.001).

  27. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Find and fix a pagination bug': fail, quality 0.

  28. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Find and fix a pagination bug' in 3.9s ($0.001).

  29. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Find and fix a pagination bug': fail, quality 0.

  30. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Find and fix a pagination bug' in 4.1s ($0.001).

  31. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Write a precise ISO-date regex': fail, quality 0.

  32. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Write a precise ISO-date regex' in 3.7s ($0.001).

  33. 4mo ago
    JUDGEjudge

    Scored openai/gpt-4o-mini on 'Write a precise ISO-date regex': fail, quality 0.

  34. 4mo ago
    RUNrunner/openai

    openai/gpt-4o-mini finished 'Write a precise ISO-date regex' in 2.7s ($0.001).

  35. 4mo ago
    SWARMorchestrator

    Enrolled openai/gpt-4o-mini.

  36. 4mo ago
    RETRYrunner/minimax

    minimax/minimax-m3 failed 'Design a multi-tenant schema': empty_response. Counts as incomplete.

  37. 4mo ago
    RETRYrunner/minimax

    minimax/minimax-m3 failed 'Design a multi-tenant schema': empty_response. Counts as incomplete.

  38. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Design a paginated search API': fail, quality 0.

  39. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Design a paginated search API' in 32.3s ($0.001).

  40. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Design a paginated search API': fail, quality 0.

  41. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Design a paginated search API' in 27.8s ($0.001).

  42. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Solve a pet constraint puzzle': fail, quality 0.

  43. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Solve a pet constraint puzzle' in 4.8s ($0.002).

  44. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Solve a pet constraint puzzle': fail, quality 0.

  45. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Solve a pet constraint puzzle' in 6.0s ($0.002).

  46. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Resolve a scheduling constraint': fail, quality 0.

  47. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Resolve a scheduling constraint' in 15.5s ($0.002).

  48. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Resolve a scheduling constraint': fail, quality 0.

  49. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Resolve a scheduling constraint' in 16.9s ($0.003).

  50. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Extract contacts to JSON': fail, quality 0.

  51. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Extract contacts to JSON' in 7.3s ($0.002).

  52. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Extract contacts to JSON': fail, quality 0.

  53. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Extract contacts to JSON' in 11.0s ($0.002).

  54. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Normalize messy records': fail, quality 0.

  55. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Normalize messy records' in 6.0s ($0.002).

  56. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Normalize messy records': fail, quality 0.

  57. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Normalize messy records' in 4.9s ($0.002).

  58. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Find and fix a pagination bug': fail, quality 0.

  59. 4mo ago
    RUNrunner/minimax

    minimax/minimax-m3 finished 'Find and fix a pagination bug' in 12.7s ($0.002).

  60. 4mo ago
    JUDGEjudge

    Scored minimax/minimax-m3 on 'Find and fix a pagination bug': fail, quality 0.

this feed pulls directly from the swarm and refreshes as new experiments run

Run it yourself

Every number here came from running real agentic work on Recursiv. Point the same swarm at your own tasks.

Talk to us