Evaluating Frontier LLMs in Answering Game-Design Questions: A Preliminary Study
Estudo da UNIFOR que avalia o desempenho de LLMs de ponta (GPT-5, Gemini 2.5 Pro, DeepSeek) na resolução de problemas de design de software para jogos. A pesquisa utiliza um protocolo 'LLM-as-a-judge' sobre 40 questões reais, concluindo que as IAs são precisas…