GulliBench: Measuring Skepticism in Frontier Models

(vetto.ai)

17 points | by rigelbm 5 hours ago ago

2 comments

  • dvaplima 5 hours ago

    I liked approach to evaluating AI behavior, the fact that additional reasoning doesn’t improve performance is quite interesting!

  • Betaantunes11 4 hours ago

    interesting approach