Mostrando postagens com marcador brasileiro. Mostrar todas as postagens
Mostrando postagens com marcador brasileiro. Mostrar todas as postagens

terça-feira, 8 de setembro de 2015

A caixinha de surpresas em números

Fiz uma simulação de 1.000 campeonatos brasileiros de futebol (20 clubes) com resultados aleatórios seguindo as probabilidades de 40:30:30 (de vitória, empate e derrota) em casa - e 30:30:40 em jogos fora. Plotei no gráfico a distribuição resultante de pontuações finais das equipes, juntamente com a distribuição das pontuações reais das equipes nos campeonatos desde 2006 (quando a fórmula atual de pontos corridos em turno e returno com 20 times foi finalmente adotada) (Fig. 1).

A média na simulação foi de 51,005 ((± 7,821) pontos. Nos campeonatos reais: 51,867 (± 11,546).


Figura 1. Distribuição de pontuações finais em campeonatos brasileiros de futebol simulados (n=1.000) e reais (n=9; período: 2006-2014).

O gráfico de correlação entre a distribuição simulada e a real, dá um índice de determinação de 0,63. Mais de 60% da variância das pontuações finais podem ser explicados pela proporção 40:30:30.


Isso indica um forte papel do acaso e confirma o forte equilíbrio (os times são muito equivalentes em termos de competitividade desportiva).

sábado, 25 de fevereiro de 2012

Analisando resultados: comparando listas 2

Na postagem anterior vimos como podemos comparar duas listas entre si, uma com a previsão e outra com o resultado final.

E quando temos três ou mais listas? Podemos utilizar o mesmo procedimento da comparação de duas listas? Sim, mas é preciso fazer uma alteração. Se usamos simplesmente o mesmo limite de 5%, para cada comparação as chances de erro se acumulam de modo exponencial: na primeira comparação temos os 5% de chances de aceitar uma hipótese como verdadeira sendo que ela é falsa (mais especificamente, de aceitar que o resultado tem significância estatística, quando, na verdade, é fruto do acaso - situação que os estatísticos chamam de erro do tipo I), na segunda comparação temos os mesmos 5%; ou seja, com duas comparações temos 1-(0,95)^2 = 9,75% de chance de errar; com três são 14,26%; com quatro, 18,55%; com dez, 40,13% e assim por diante.

Um método para corrigir isso é a correção de Bonferroni: simplesmente divide o nível de significância desejado pelo número de comparações realizadas.

Peguemos as previsões das classificações dos clubes brasileiros no Campeonato Brasileiro de Futebol da Série A de 20102011 feitas por nove jornalistas esportivos. E comparemos com o resultado final. Serão, no total, nove comparações. Se quisermos um nível de 5%, basta dividir 5%/9 e usar esse valor como o nível de aceitação ou rejeição para cada teste. Nas 9 comparações, a probabilidade acumulada de erro será de 4,9%.

A tabela abaixo mostra o resultado.

Todos os testes rejeitaram a hipótese nula de que a classificação prevista é igual à classificação final. Isto é, os palpites dos jornalistas esportivos foram todos furados. Como o palpite da Goldman Sachs para a Copa 2006.