quinta-feira, 18 de novembro de 2010

A triste luta contra imprensa chapa-branca

Eu terminei de ler Em Brasília 19 Horas de Eugênio Bucci. Pois bem, já havia mencionado isto em um post anterior sobre isto (os sete pecados capitais da imprensa). Mas existem também os sete pecados capitais do discurso autoritário

Para tornar mais claro vou listar os 7 aqui mesmo:
Os sete pecados capitais do discurso autoritário: 

I - O esquecimento proposital - sonegar a história e ocultar os fatos que não convêm ao argumento. 

II - O coletivo compulsório - Dizer "nós" para impor obediência e intimidar as divergências. 

III - A futrica instrumental - semear a intriga palaciana para prejudicar os que pensam diferente. 

IV - A apologia do aparelhismo - promover - abertamente ou, se necessário, de forma dissimulada - o uso dos meios de comunicação públicos para fins do grupo que governa. 

V - O ódio à imprensa - banir reportagem e profetizar que todo jornalismo será castigado. 

VI - A arrogância sem substância - desdenhar dos outros para desqualificá-lo. 

VII - Condenar a priori - Acusar pelas costas, na escuridão, sem provas e sem tolerar o direito de defesa. 


Além destes existem os sete pecados capitais da imprensa:
  1. Distorção deliberada ou inadvertida; 
  2. culto das falsas imagens; 
  3. invasão da privacidade; 
  4. assassinato de reputação; 
  5. superexploração do sexo; 
  6. envenenamento das mentes infantis
  7. abuso de poder

Bem, vou mostrar um texto aqui publicado ontem na página da UnB. Vejam se o mesmo sofre ou não de alguns dos pecados listados ou no discurso autoritário ou nos pecados da imprensa.

A outra UnB
Ex-aluno e jornalista João Campos fala sobre as mudanças testemunhadas na universidade nos últimos três anos

João Campos - Da Secretaria de Comunicação da UnB
Quando me formei jornalista pela Universidade de Brasília, há apenas três anos, a UnB era outra. Não via estudantes, professores e técnicos abraçados, como na emocionante luta junto à administração pela manutenção salarial dos servidores, que resultou na greve mais longa da história do país, no primeiro semestre de 2010.
Não via a presença de servidores técnico-administrativos e jovens alunos nas salas de reunião da administração superior. Era coisa rara e, quando ocorria, os segmentos tradicionalmente excluídos das decisões sobre a instituição que ajudam a construir não tinham voz diante da supremacia declarada dos docentes.
Não se via obras para a expansão da universidade. A criação de novos cursos não era assunto nos corredores. Os campi de Planaltina, Gama e Ceilândia, talvez o projeto mais ambicioso e necessário da UnB, estavam aprisionados no papel. A vida circulante em uma das maiores universidades desse gigantesco país, com suas Artes, Tecnologias, Humanidades, Exatas e Ciências da Vida, estava apagada por uma apatia geral e obscura.
Quando convidado para deixar um grande jornal da cidade e agregar a equipe da Secretaria de Comunicação da UnB, há cerca de dois anos, me surpreendi. Encontrei o diálogo que serviu de base para a construção de um modelo inovador e democrático de gestão compartilhada, onde quem é da UnB – independente do grau de escolaridade ou do tempo de casa – consegue ser ouvido.
Encontrei um campus vivo, com suas Aulas da Inquietação, reuniões constantes e legítimas do Conselho Universitário e eventos à altura da UnB, como a Semana Universitária. Encontrei a ética numa gestão transparente, que reduziu drasticamente os gastos, principalmente dos famigerados cartões coorporativos. Encontrei portas abertas para os reclames e protestos de uma comunidade participativa e, acima de tudo, fiscalizadora. Encontrei, principalmente, coragem para abrir o debate e o caminho rumo a construção coletiva de um Congresso Estatuinte para a UnB. 
E encontrei problemas. Vários deles. Como o desafio de promover uma expansão histórica sem perda de qualidade na formação dos estudantes e nas condições de trabalho dos profissionais, a desvalorização dos servidores que carregam o ensino superior nas costas e a dificuldade de regularizar a situação de centenas de funcionários ainda sem vínculos formais com a universidade.
Como jornalista, prezo, acima de tudo, a ética no meu trabalho. Não sou um criador de ilusões para os leitores nem para os meus chefes. Mas não posso fechar os olhos ao que salta à vista nas caminhadas diárias pelos campi. E é por isso que afirmo: dois anos depois de o professor José Geraldo de Sousa Junior e sua equipe assumirem a administração, a UnB é outra. 

Alternativamente, pode-se também analisar isto não como uma peça de jornalismo mas de publicidade institucional. Aí o texto está dentro do que se espera, apenas com a formatação de peça jornalística - neste caso é importante que se reconheça pelo que ele realmente é: propaganda.

quarta-feira, 17 de novembro de 2010

Quantas pessoas em uma sala...

Estão fazendo aniversário naquele dia?

Esta reposta dependerá do número de pessoas na sala. Mas mais interessante do que isto é a pergunta: para ter uma probabilidade de 50% de X acontecer quantas pessoas devem estar em uma sala?

Um exemplo: Quantas pessoas devem ter em uma sala para ter uma probabilidade de 50% de duas pessoas terem o mesmo dia de aniversário? A resposta neste caso é 23 pessoas. Parece contra-intuitivo mas na realidade não é.

Outro exemplo: Quantas pessoas devem ter em uma sala para ter uma probabilidade de 50% de outra pessoa ter o mesmo dia de aniversário que você? A resposta neste caso é 253 pessoas. Este número é mais alto que a metade +1 das pessoas na sala.

A diferença entre os dois casos é que no primeiro caso não nos importamos com quais pessoas terão o mesmo aniversário, mas no segundo nós nos importamos.

O conceito é simples ao extremo. Supondo uma distribuição uniforme de 0 a M teremos que para o primeiro exemplo, a probabilidade é dada por:

p(n) = 1-M!/(M)^N * 1/(M-N)!

No segundo caso teremos:

p(n)= 1 - (1-1/M)^N

Podemos utilizar isto para as mais variadas formas de encontrar "coincidências" em uma sala. Note que no caso do aniversário M=365. Mas e se estivermos tratando de um acontecimento que ocorre em média a cada mês ao invés de a cada ano?

Neste caso a coisa fica mais interessante: Para o caso de não nos importamos quais as pessoas precisamos de 7 pessoas para probabilidade maior que 50%. E para o outro caso precisamos de 21 pessoas.

Em um post futuro vamos entrar em mais detalhes nisto...

99+%

O título indica que é mais de 99% e menos de 100%.

O que é bem apropriado para a questão que levanto hoje: o quanto é razoável? Ou seja com que precisão podemos declarar "Ah, tá bom!"

Em engenharia utiliza-se 90% e mais recentemente 95%. Mas nem sempre é o suficiente. As vezes chega-se a 99.999999% ou mais (a situação de comunicações digitais tem casos assim).

Mas vamos ficar com os 90% por enquanto. Ele diz literalmente "Em média, de cada 10 avaliações teremos 9 corretas". Parece pouco? Bem, considere outras situações menos técnicas: o sistema judiciário tem uma taxa desta ordem (1 errada em 10 avaliações?). Na realidade não chega nem perto disto.

Outra alternativa melhor são os 95%. Isto que dizer "Em média, de cada 20 avaliações teremos 19 corretas". Bem já é melhor, mas ainda parece pouco?

Ahhh... o que você quer é certeza, não?

Então pode esquecer: isto não existe! O que existe é a chance de estar certo (que pode ser bem alta em várias situações - mas não há maneira de garantir que será 100%).

Este é um resultado importante: vão acontecer atrasos, motores irão pifar, vai chover quando não se espera, tudo isto faz parte dos resultados possíveis.

O truque é sempre este: saber que isto faz parte e que deve-se estar preparado para tanto. No caso de atrasos e problemas mecânicos um telefone celular (ou mesmo um cartão telefônico) pode fazer a diferença. No caso de chuva, guarda-chuvas nos locais aonde você mais passa seu tempo podem não vir a serem inúteis.

É o famoso caso do "Não é Se, mas Quando.". Existem outros mecanismos para se evitar que um acontecimento improvável se transforme em um acontecimento imprevisto.

Mas o mecanismo mais adotado pela sociedade é o seguro.

Essencialmente ele considera que você paga para ser ressarcido no caso de determinadas situações. Quanto menor a chance do evento acontecer, menor é o pagamento. A idéia é que um possível prejuízo seja anulado por quantidade cuidadosamente acertada.

Essencialmente é baseado na expectativa de perda. Vamos supor que haja dois eventos mutuamente exclusivos. E1 e não E1. Se não E1 ocorre você não perde nada, mas se E1 ocorrer você perde R$ X.

Tudo fica a cargo das probabilidades: p(E1) e 1- p(E1). O Valor esperado da perda é:
p(E1)*X+(1-p(E1)*0 = p(E1)*X

Se p(E1) é suficientemente pequeno, o valor esperado da perda é pequeno também. Mas para tornar mais claro vamos dizer que se não E1 ocorrer você terá um pequeno ganho tal que:

p(E1)*X+(1-p(E1))*Y = 0 ou Y= p(E1)/(1-p(E1)*X

Este é o valor da aposta que deve ser feito para compensar 1 tentativa com E1 e não E1.

Colocando em números: se X é R$ -1000,00, p(E1)=0.01 então Y = R$ 10,10

Este seria o valor do seguro! Mas vamos supor que ao invés de uma tentativa temos agora várias:

A probabilidade de não ocorrer E1 depois de N tentativas é: 1- (1-p(E1))^N . O seguro neste caso foi N*Y.

Então se fizermos N=100 teremos 1-(1-p(E1))^N = 0.6339676587 e teríamos gasto R$ 1010,10. O valor esperado da perda, ao invés de R$ 1000,00 passou a ser de apenas R$ 264,24.

Esta é a filosofia por trás do seguro. Se aumentarmos o valor do prêmio, podemos equilibrar mesmo após várias tentativas.

E um ponto muito interessante: o seguro implica em planejamento e quantificação de risco. Ou seja, o seguro é um passo além da análise qualitativa e um dentro da análise quantitativa.

domingo, 14 de novembro de 2010

Encontrando soluções

Na realidade, encontramos raízes.

Em uma equação as vezes é necessário encontrar a solução. Por que? Isto depende, pode ser que esta solução defina um ponto ótimo de operação ou coisa que valha. Mas o interesse de hoje é em como encontrar uma solução.

O melhor exemplo é o seguinte: peça para um colega escolher um número de 1 a 100. E diga que vai descobrir o número somente com respostas do tipo sim ou não.

Para começar você começa com a pergunta: este número é maior que 50?

E aí com uma série de perguntas é possível descobrir que número é esse. Vamos fazer o processo para 2 casos (37 e 62)

No caso de 37:
  1. o número é maior que 50? Não
  2. o número é maior que 25? Sim
  3. o número é maior que 38? Não
  4. o número é maior que 32? Sim
  5. o número é maior que 35? Sim
  6. o número é maior que 37? Não
  7. o número é maior que 36? Sim
Então o número é 37 - e encontrei com 7 perguntas

No caso de 62

  1. o número é maior que 50? Sim
  2. o número é maior que 75? Não
  3. o número é maior que 63? Não
  4. o número é maior que 57? Sim
  5. o número é maior que 60? Sim
  6. o número é maior que 62? Sim

Então o número é 63 - e encontrei com 6 perguntas.

Esta não é a unica maneira, se pudermos usar mais informações além do sim ou não, a coisa pode ser ainda mais rápida. No caso consideremos duas possubilidades (para o caso do número 37)
a) o número é menor que 33
b) o número é maior que 66
c) nenhuma das duas
No caso do 37 temos:
Letra c. Próximas perguntas:
a) o número é menor que 44
b) o número é maior que 55
c) nenhuma das duas
Letra a. Próximas perguntas:
a) o número é menor que 37
b) o número é maior que 41
c) nenhuma das duas
Letra c. Próximas perguntas
a) o número é menor que 38
b) o número é maior que 40
c) nenhuma das duas
Letra a. O número é 37

Desta vez, encontramos o número com apenas 4 perguntas. Estes esquemas são encontrados para encontramos raízes em equações, mas o princípio pode ser usado para virtualmente qualquer coisa.

sexta-feira, 12 de novembro de 2010

Qual é a probabilidade de escolhermos aleatóriamente um número par?

Esta é uma questão ligada a proporções. No fundo, pela definição frequentista da probabilidade temos uma proporção entre os números pares e os números ímpares.

Números Pares: 2*n
Números Ímpares: 2*n-1

Números totais (pares + ímpares): 4*n-1

Portanto temos:

p(par) = 2*n/(4*n-1)
p(ímpar) = (2*n-1)/(4*n-1)

Se fizermos n tender a infinito temos:

p(par) = 1/2
p(ímpar) = 1/2

Mas e que o número seja múltiplo de 2? Neste caso é a mesma questão que seja par (pois todo par e múltiplo de 2)

E se for múltiplo de 3?

Neste caso temos 3*n são os números múltiplos de 3. Mas não temos uma expressão para os que não são múltiplos de 3. No entanto sabemos que em um intervalo 1 a k existirão no máximo k/3 múltiplos.

Isto pode ser testado com k=10 e k=20

Para k=10, teremos no máximo 10/3 ou 3.333 múltiplos (3, 6 e 9)
Para k=20, teremos no maximo 20/3 ou 6.666 múltiplos (3, 6, 9, 12, 15 e 18)

E assim sucessivamente. Portanto dividindo k/3 por k temos uma aproximação da razão e logo da probabilidade.

O mesmo pode ser usado para qualquer número, mas se quisermos encontrar este número para mais de um denominador comum a coisa complica. Vamos exemplificar:

Qual é a chance que um número seja múltiplo de 2 ou 3?

No intervalo de 1 a 10 podemos fazer este cálculo (2, 3, 4, 6, 8, 9, 10). Ou seja 7/10 (0.7).

Se fizemos as contas com as fórmulas 1/2+1/3 = 5/6 (0.8333). Por que deu diferente? Porque 6 é múltiplo de 2 e 3. Se retirarmos deste intervalo a contagem dupla teremos 1/2+1/3-1/10 (que daria 0.7333, já bastante próximo do valor real 0.7).

Este tipo de problema fica mais complicado a medida que os números aumentam, pois no final um número muito grande começa a se tornar múltiplo de diversos denominadores comuns.

Isto é um fator importante quando queremos descobrir qual é a probabilidade de escolhermos um primo ou um produto de primos em um determinado intervalo. Sabemos que por definição esta probabilidade é 1 (na realidade bem próxima - há a questão do número 1).

No caso temos 1/2+1/3+1/5+1/7 = 247/210 (1.1762)

Menos a probabilidade de ser 6 e 10 (1/10+1/10 = 2/10)

O resultado é 1/2+1/3+1/5+1/7-2/10 = 41/42 (0.9762)

Mas isto traz uma questão interessante: qual é a probabilidade de escolhermos aleatóriamente um número primo?

Sabemos que:
de 1 a 10 temos 4 primos (0.4)
de 1 a 20 temos 8 primos (0.4)
de 1 a 30 temos 10 primos (0.3)
de 1 a 40 temos 12 primos (0.3)
de 1 a 50 temos 15 primos (0.3)
de 1 a 60 temos 17 primos (0.283)
de 1 a 70 temos 19 primos (0.271)
de 1 a 80 temos 22 primos (0.275)
de 1 a 90 temos 24 primos (0.267)
de 1 a 100 temos 25 primos (0.25)
...
De 1 a 1000 temos 168 primos (0.168)
De 1 a 10.000 temos 1229 primos (0.1229)
De 1 a 100.000 temos 9592 primos (0.09592)

Claramente ao aumentarmos o intervalo a probabilidade de escolhermos aleatóriamente um número primo diminui enormemente.

Mas a investigação das consequências disto fica para um post futuro.

quinta-feira, 11 de novembro de 2010

O passado desconstrói o nosso presente - parte 5

Estou lendo o livro Em Brasília 19 Horas de Eugênio Bucci. O livro é bem interessante e razoavelmente isento.

O tópico principal é a tentativa que foi realizada de tornar a Radiobrás mais democrática e menos "chapa-branca".

Fiquei curioso a respeito de um personagem que ele mencionou: Bernardo Kucinski.

Ele não coloca este referido jornalista e professor em termos elogiosos. Mas inclui no texto algo sobre um livro que ele escreveu: As cartas ácidas da campanha de Lula de 1998

Para minha sorte o livro está disponível no Google Books. É bem verdade que não está inteiro, mas a leitura é menos interessante. Um ponto muito interessante é que nele podemos ver claramente os sete pecados capitais da imprensa que Eugênio Bucci explicita em outro livro (Sobre a Ética e a Imprensa).

Em poucas palavras, o autor de Cartas Ácidas mostra como enganar, iludir, dissimular, explorar meias verdades - tudo em benefício de um "bem maior".

Este tipo de comportamento tem nome e sobrenome...

quarta-feira, 10 de novembro de 2010

O passado desconstrói o nosso presente - parte 4

Desta vez fui dar uma olhada sobre a questão da moralidade nas campanhas eleitorais.

Não dos candidatos, mas dos seus militantes...

E o resultado que sumarizo aqui é bem interessante:

"Nas menções que se referiram à ética pessoal de José Serra, 89% foram negativas, enquanto para Dilma Rousseff esse percentual foi de 70%."

" Entre os tópicos relacionados à moral, o aborto foi mais citado, e há mais menções sobre o tema com atributos negativos ao candidato Serra (71%) que à candidata Dilma (54%)."

"A arena em que as militâncias políticas se enfrentaram foi o Orkut. As comunidades da rede social mais tradicional e de maior alcance no pais foram palco de longas discussões entre apoiadores dos dois candidatos.
O Twitter foi a rede mais neutra: mais da metade das menções analisadas repercutiam dados factuais da corrida eleitoral, cobertos pela grande mídia.
Em todas as redes, os conteúdos positivos e neutros sobre a candidata Dilma Rousseff superaram os negativos, enquanto para José Serra essa proporção só se deu no Twitter."

Mais uma vez: as pessoas justificaram suas opiniões com seus próprios preconceitos.

Seria bom se prestássemos atenção a isto

segunda-feira, 8 de novembro de 2010

O passado desconstrói o nosso presente - parte 3

Estou vendo na internet uma série de discussões sobre a anistia (de 1979).

Enquanto há algumas questões pertinentes, há outras totalmente fora de propósito.

É com a finalidade de esclarecer alguns pontos que coloco o seguinte clip:

Uma falácia bastante comum hoje em dia

Existem diversas classificações de falácias. Entre elas destaco a do historiador. Em poucas palavras está falácia é a incapacidade das pessoas do passado de saberem o futuro.

E com isto obviamente, estas pessoas não tinham a capacidade de saber se suas ações iriam ou não dar certo.

Hoje nós sabemos o resultado, eles não sabiam.

E pela mesma lógica inexorável, se nós estivéssemos nos sapatos delas não teríamos como saber o desenrolar de nossas decisões.

Isto indica que avaliar decisões passadas supondo que as pessoas envolvidas tinham conhecimento dos desenvolvimentos futuros é uma falácia lógica - um anacronismo. Naturalmente isto quer dizer que uma avaliação tem que levar em conta a natureza incerta que qualquer decisão tomada possui naturalmente.

O que não quer dizer que determinados resultados não sejam mais prováveis do que outros. E nisto é que mora a verdadeira força de uma análise bem realizada. Claro que o difícil é exatamente descobrir o que era mais provável e se as pessoas envolvidas nas decisões tinham acesso a estas informações.

É muito fácil criticar uma decisão errada após o acontecido. Difícil mesmo é criticar uma decisão errada antes de se saber que ela é realmente errada - e acertar os resultados é claro.

sexta-feira, 5 de novembro de 2010

E o caso Finatec continua

Hoje eu tenho uma opinião muito distinta da que tinha anteriormente: se a administração superior e os pseudo-magister querem tanto acabar com as fundações de apoio, então que acabem.

Tive notícias que um dos ex-dirigentes da Finatec foi condenado em justiça. A notícia não é clara, mas pode ser que o mesmo tenha sido condenado a 10 anos e 10 meses. Isto me deixa muito triste de dois modos: o primeiro é que acreditei na inocência do mesmo e assim agora não posso mais crer nisto com tanta certeza. E naturalmente o segundo modo é que isso é mais munição para acabar com a Finatec.

Os outros pedaços de informação vem de abaixo assinado de colegas em um blog e outro texto escrito claramente por alguém da UnB ligado ao Partido da Causa Operária (PCO).

Em suma: no blog queriam que o credenciamento não ocorresse porque as contas não foram aprovadas (e nem rejeitadas) e no blog basicamente chamam todos os que votaram pelo recredenciamento de criminosos.

Pesquisas e Equívocos 14

Depois do resultado temos um caso interessante advindo dos resultados. Afinal, os votos dos candidatos teriam de vir de algum lugar. E este lugar é evidentemente o poço dos votos no primeiro turno.

Podemos tentar estimar a transição dos votos após o primeiro turno utilizando Bayes a posteriori

Então, utilizando a linguagem das probabilidades podemos dizer que:
  • Votos de Dilma no primeiro turno = P(Dilma 1o turno)
  • Votos de Serra no primeiro turno = P(Serra 1o turno)
  • Votos de Marina no primeiro turno = P(Marina 1o turno)
  • Votos de Branco/Nulo no primeiro turno = P(Branco/Nulo 1o turno)
Então temos que necessariamente:
  • P(Dilma 2o turno) = P(Dilma 2o turno | Dilma 1o turno)*P(Dilma 1o turno) + P(Dilma 2o turno | Serra 1o turno)*P(Serra 1o turno) + P(Dilma 2o turno | Marina 1o turno)*P(Marina 1o turno) +P(Dilma 2o turno | Brancos/Nulos 1o turno)*P(Brancos/Nulos 1o turno)
E para Serra e Brancos/Nulos teremos uma análise semelhante. De acordo com a pesquisa do Datafolha:

  • P(Dilma 2o turno) = 0.91*0.4285+0.06*0.2979+0.35*0.1766+0.22*0.0864 = 0.488627
  • P(Serra 2o turno) = 0.06*0.4285+0.9*0.2979+0.47*0.1766+0.27*0.0864 = 0.40015
  • P(Brancos/Nulos 2o turno)=0.01*0.4285+0.01*0.2979+0.12*0.1766+0.42*0.0864 = 0.064744

Isto dá 0.953521 portanto ficam cerca de 0.046479 ainda sem contar

Se compararmos com os resultados finais temos:

  • P(Dilma 2o turno) = 48.8627% e votação 52.29%
  • P(Serra 2o turno) = 40.015% e votação 41.01%
  • P(Brancos/Nulos 2o turno) = 6.4744% e votação 6.70%

Os resultados de todos são próximos com exceção do de Dilma, mas se contarmos os 4.65% que sobram estes poderiam explicar a divergência

quarta-feira, 3 de novembro de 2010

Voce sabe que os idiotas estão dominando o mundo quando...

"Conselho Nacional da Educação caracteriza como racista o conteúdo da obra Caçadas de Pedrinho, de Monteiro Lobato, considerado um dos maiores escritores de literatura infantil do país."

Não estou brincando, triste não?

terça-feira, 2 de novembro de 2010

29 milhões,197 mil e 152 eleitores

Este é o número de eleitores que não compareceram a eleição no último domingo. Os "analistas" dizem que a culpa é do feriado.

Mas será mesmo verdade? Como descobrir? Bem, podemos utilizar como linha base a abstenção no primeiro turno. Esta foi de 24 milhões, 610 mil e 296 eleitores.

Hummm, não é tão diferente assim, não é mesmo? Temos que no segundo turno um acréscimo de 4 milhões, 586 mil e 856 eleitores ao número já alto do primeiro turno. Podemos assinalar todo este efeito ao feriado?

Talvez seja interessante comparar a abstenção de primeiro e segundo turno de outras eleições.

  • 2010 - Primeiro turno: 24.610.296 (18,12%), Segundo turno: 29.197.152 (21,50%), Diferença: 3.38%
  • 2006 - Primeiro turno: 21.092.675 (16,75%), Segundo turno: 23.914.714 (18,99%), Diferença: 2.24%
  • 2002 -  Primeiro turno: 20.448.233 (17,74%), Segundo turno: 23.589.188 (20,47%), Diferença: 2.73%

Com base nestes nisto é difícil dizer que a culpa é do feriado.

domingo, 31 de outubro de 2010

Pesquisas e Equívocos 13

Agnelo é o governador do DF. E desta vez a pesquisa Datafolha acertou direitinho:

  • Votos totais de Agnelo - 59.4%, votos totais da pesquisa Datafolha: 57%
  • Votos totais de Weslian - 30.2%, votos totais da pesquisa Datafolha: 31%

O mesmo pode ser observado com relação aos votos válidos:

  • Votos válidos de Agnelo - 66.2%, votos totais da pesquisa Datafolha: 64%
  • Votos válidos de Weslian - 33.9%, votos totais da pesquisa Datafolha: 36%

Ainda resta ver se as cidades sigma funcionaram como preditores, mas isto pode ser feito ao final da apuração.

sexta-feira, 29 de outubro de 2010

Mais alguns dias e voltarei a postar

Estou bem atarefado por uns tempos. Mas com a chegada do final de semana da eleição acredito que terei novamente tempo para postar.

Em tempo, estou curioso a respeito de dois problemas: a convergência de um processo estocástico - como as eleições - e a questão de proporções de moedas em dois sacos diferentes.

Espero poder fazer um estudo interessante a este respeito

segunda-feira, 25 de outubro de 2010

quarta-feira, 20 de outubro de 2010

A questão da variável aleatória na Transformada da Incerteza - parte 2

Depois de pensar sobre quais variáveis, decidi por duas: IDH e população. Eu sei que é uma escolha arbitrária, mas fazia um certo sentido.

Então ao invés de um problema com uma variável aleatória, eu passava a ter duas.

Utilizando os dados do PNUD consegui compilar uma lista de municípios de Goiás com dados de população e IDH. Tudo de 2000, mas esta é uma questão menor.

Então apliquei a teoria da transformada da incerteza. As cidades que eu selecionei foram:


  • Aloândia
  • Goainópolis
  • Caldas Novas
  • Aguás Lindas de Goiás
  • Anápolis
  • Goiânia

Os pesos foram, respectivamente:
  •     0.2757
  •     0.0345
  •     0.1505
  •     0.1854
  •     0.1346
  •     0.2193
Com isto, temos as informações necessárias para o cálculo da estimativa de presidente e governador. Após o qual, podemos comparar com os resultados reais.
Para presidente tivemos:
  • Dilma - Cidades Sigma:  43.0%, resultado final de votação 42.23%
  • Serra - Cidades Sigma:  39.5%, resultado final de votação 39.48%
  • Marina - Cidades Sigma:  16.3%, resultado final de votação 17.18%
Animado por estes resultados, resolvi fazer para governador:
  • Íris Rezende - Cidades Sigma:  39.3%, resultado final de votação 36.38%
  • Marcone Perillo - Cidades Sigma:  46.9%, resultado final de votação 46.33% 
  • Vanderson - Cidades Sigma:  13.2%, resultado final de votação 16.62%
Os resultados são muito próximos. Temos de lembrar que só fizemos o cálculo da votação para seis cidades.

terça-feira, 19 de outubro de 2010

Mais diferenças entre resultados em votos e pesquisas

Então resolvi fazer a mesma análise para a votação de governadores nas capitais. E o que obtive foi:

  • Bahia (Salvador) - Wagner - eleição 54% e pesquisa 50%, Souto - eleição 13% e pesquisa 17%, Geddel - eleição 9% e pesquisa 13%
  • Minas Gerais (Belo Horizonte) - Anastasia - eleição 62% e pesquisa 54%, Costa - eleição 20% e pesquisa 29%, Aparecido - eleição 4% e pesquisa 1%
  • Pernambuco (Recife) - Campos - eleição 64% e pesquisa 66%, Jarbas - eleição 18% e pesquisa 21%, Xavier - eleição 3% e pesquisa 2%
  • Rio de Janeiro (Rio de Janeiro) - Cabral - eleição 52% e pesquisa 58%, Gabeira - eleição 22% e pesquisa 21%, Peregrino - eleição 5% e pesquisa 5%
  • Rio Grande do Sul (Porto Alegre) - Tarso - eleição 47% e pesquisa 46%, Fogaça - eleição 24% e pesquisa 27%, Yeda - eleição 16% e pesquisa 10%
  • São Paulo (São Paulo) - Alckmin - eleição 44% e pesquisa 45%, Mercadante - eleição 32% e pesquisa 28%, Russomano - eleição 6% e pesquisa 10%

Já no resultado estadual completo temos:

  • Bahia - Wagner - eleição 55% e pesquisa 52%, Souto - eleição 14% e pesquisa 19%, Geddel - eleição 13% e pesquisa 14%
  • Minas Gerais - Anastasia - eleição 53% e pesquisa 47%, Costa - eleição 29% e pesquisa 36%, Aparecido - eleição 2% e pesquisa 1%
  • Pernambuco - Campos - eleição 68% e pesquisa 70%, Jarbas - eleição 12% e pesquisa 17%, Xavier - eleição 2% e pesquisa 1%
  • Rio de Janeiro - Cabral - eleição 55% e pesquisa 59%, Gabeira - eleição 17% e pesquisa 19%, Peregrino - eleição 9% e pesquisa 6%
  • Rio Grande do Sul - Tarso - eleição 49% e pesquisa 48%, Fogaça - eleição 23% e pesquisa 24%, Yeda - eleição 17% e pesquisa 14%
  • São Paulo (São Paulo) - Alckmin - eleição 46% e pesquisa 50%, Mercadante - eleição 32% e pesquisa 26%, Russomano - eleição 5% e pesquisa 9%

E por fim, o resultado em votos válidos da eleição e da pesquisa:

  • Bahia - Wagner - eleição 64% e pesquisa 58%, Souto - eleição 16% e pesquisa 21%, Geddel - eleição 15% e pesquisa 16%
  • Minas Gerais - Anastasia - eleição 63% e pesquisa 55%, Costa - eleição 34% e pesquisa 42%, Aparecido - eleição 2% e pesquisa 1%
  • Pernambuco - Campos - eleição 83% e pesquisa 79%, Jarbas - eleição 14% e pesquisa 19%, Xavier - eleição 2% e pesquisa 1%
  • Rio de Janeiro - Cabral - eleição 66% e pesquisa 67%, Gabeira - eleição 21% e pesquisa 21%, Peregrino - eleição 10% e pesquisa 7%
  • Rio Grande do Sul - Tarso - eleição 54% e pesquisa 55%, Fogaça - eleição 25% e pesquisa 27%, Yeda - eleição 18% e pesquisa 16%
  • São Paulo (São Paulo) - Alckmin - eleição 51% e pesquisa 55%, Mercadante - eleição 35% e pesquisa 28%, Russomano - eleição 5% e pesquisa 9%

Como é possível se verificar, há erros de 4% e até maiores (9%) surgindo na comparação entre pesquisas e resultados. O erro fica pior quando se tenta estimar o número de votos válidos.

Então podemos ver que é uma tendência nestes resultados de pesquisa apresentarem margens de erro bem superiores ao esperado. No caso do resultado nas capitais, o desvio padrão foi de 4.36% e no caso do resultado nos estados, o desvio padrão foi 3.86%

segunda-feira, 18 de outubro de 2010

Algo estranho nas pesquisas e resultados eleitorais

Depois da diferença de mais de 2% no Rio para Cabral, e dada a diferença razoável no resultado final de Dilma e das pesquisas resolvi dar uma olhada nas predições e resultados.

E qual foi a surpresa? A diferença está presente em diversos locais:

  • Bahia - Dilma - Resultado 56% e Pesquisa 57%
  • Ceará - Dilma - Resultado 59% e Pesquisa 64%
  • DF - Marina - Resultado 39% e Pesquisa 34%
  • Minas Gerais - Dilma - Resultado 43% e Pesquisa 47%
  • Paraná - Serra - Resultado 41% e Pesquisa 38%
  • Pernambuco - Dilma - Resultado 55% e Pesquisa 62%
  • Rio de Janeiro - Dilma - Resultado 39% e Pesquisa 44%
  • Rio Grande do Sul - Dilma - Resultado 44% e Pesquisa 44%
  • São Paulo - Dilma - Resultado 35% e Pesquisa 38%

Então dá para ver que os resultados do Ceará (5%), DF (5%), Minas Gerais (4%), Paraná (3%), Pernambuco (7%), Rio de Janeiro (5%) e São Paulo (3%) divergiram além da margem de erro de 2%.

Acho que é o caso de olhar os resultados dos governadores também - com ênfase nestes estados

Precisão das Pesquisas

Realizei o teste para cidade do Rio de Janeiro.

Aos curiosos, as cidades são estas (em ordem de tamanho)


  • RJ CARAPEBUS

  • RJ SAPUCAIA

  • RJ CORDEIRO

  • RJ MIGUEL PEREIRA

  • RJ ITATIAIA

  • RJ ARRAIAL DO CABO

  • RJ CASIMIRO DE ABREU

  • RJ MANGARATIBA

  • RJ BOM JESUS DO ITABAPOANA

  • RJ SAO JOAO DA BARRA

  • RJ GUAPIMIRIM

  • RJ RIO BONITO

  • RJ VALENCA

  • RJ ITAPERUNA

  • RJ ARARUAMA

  • RJ ANGRA DOS REIS

  • RJ TERESOPOLIS

  • RJ CABO FRIO

  • RJ MESQUITA

  • RJ NILOPOLIS

  • RJ BARRA MANSA

  • RJ NOVA FRIBURGO

  • RJ ITABORAI

  • RJ MAGE

  • RJ VOLTA REDONDA

  • RJ PETROPOLIS

  • RJ BELFORD ROXO

  • RJ CAMPOS DOS GOYTACAZES

  • RJ SAO JOAO DE MERITI

  • RJ NITEROI

  • RJ NOVA IGUACU

  • RJ DUQUE DE CAXIAS

  • RJ SAO GONCALO

  • RJ RIO DE JANEIRO


O resultado publicado pelo TSE foi:

  • Cabral com 54.51%, Gabeira com 17.06% e Peregrino com 8.91% (votos totais)

O resultado que calculei com as 34 cidades foi:

  • Cabral com 53.75%, Gabeira com 18.47% e Peregrino com 7.89% (votos totais)

A maior diferença é de 1.4%.

A pesquisa que foi publicada os resultado indicava Cabral com 59%, Gabeira com 19% e Peregrino com 6%.  Note que apesar do resultado nas pesquisas para Gabeira e Peregrino ter sido muito próximo do real, considerando os resultados que calculei para os municípios da pesquisa, há uma discrepância razoável entre o percentual de votos obtido por Cabral tanto nas cidade quanto no cômputo total.

Isto significa duas coisas: o erro de amostragem por limitar o número de cidades existe e uma indicação que o erro parece se restringir à Cabral. Ao olharmos a cidade do Rio de Janeiro, a votação foi de 52.36% para Cabral, 22.19% para Gabeira e 5.33% para Peregrino. Já a pesquisa indicou 58% para Cabral, 21% para Gabeira e 5% para Peregrino.

Mas ao mesmo tempo, parece que a questão está ligada às regiões mais densamente povoadas (como a Capital). Isto pode ser verificado pois a média dos percentuais é 56.64%

Seja o que for, fica uma certeza e uma dúvida:
  • A amostragem do estado por cidades introduz um erro que chegou a 1.4%
  • Há um viés estranho acerca do resultado de Cabral

Forma de verificar precisão das pesquisas

Depois de encontrar os pontos sigma para o caso de pesquisas eleitorais, pensei um pouco em uma forma de determinar a precisão das pesquisas que vemos por aqui.

Bem, eu achei...

O problema é que não tenho acesso aos dados completos.

A idéia é verificar, para as cidades escolhidas em uma pesquisa, como foi o desempenho das mesmas na eleição. E a partir daí comparar o desempenho da pesquisa eleitoral com a cidade.

Há um problema: esta comparação só pode ser realizada com pesquisas bem próximas a data de eleição.

Eu tenho muita curiosidade em descobrir quais foram as cidades escolhidas na pesquisa e quantas pessoas foram entrevistadas em cada cidade. No caso da pesquisa Datafolha, as cidades pesquisadas são mostradas aqui.

Mas a parte chata é que são muitos municípios (por exemplo: na Bahia são 49). Na pesquisa Datafolha, aos estados estudados são Bahia (49), Pernambuco (43), Minas Gerais (90), Rio de Janeiro (34), Rio Grande do Sul (58), São Paulo (66) e Distrito Federal.

No caso do DF não dá para fazer o teste devido a questão das zonas eleitorais. A meu ver restam como opções Rio de Janeiro e Pernambuco.

Vou fazer o teste e publico em outro post

sexta-feira, 15 de outubro de 2010

Uma curiosidade a respeito do DF

Segundo a última pesquisa DATAFOLHA, temos um quadro interessante na nossa mão:
Para Agnelo:

  • 95% das pessoas que votaram em Agnelo no primeiro turno, votam em Agnelo no segundo turno
  • 5% das pessoas que votaram em Roriz no primeiro turno, votam em Agnelo no segundo turno
  • 45% das pessoas que votaram em Toninho no primeiro turno, votam em Agnelo no segundo turno
  • 16% das pessoas que votaram em Branco no primeiro turno, votam em Agnelo no segundo turno

Para Roriz:

  • 3% das pessoas que votaram em Agnelo no primeiro turno, votam em Roriz no segundo turno
  • 90% das pessoas que votaram em Roriz no primeiro turno, votam em Roriz no segundo turno
  • 19% das pessoas que votaram em Toninho no primeiro turno, votam em Roriz no segundo turno
  • 12% das pessoas que votaram em Branco no primeiro turno, votam em Roriz no segundo turno
Em Branco/Nulo:

  • 0% das pessoas que votaram em Agnelo no primeiro turno, votam em Branco no segundo turno
  • 1% das pessoas que votaram em Roriz no primeiro turno, votam em Branco no segundo turno
  • 24% das pessoas que votaram em Toninho no primeiro turno, votam em Branco no segundo turno
  • 54% das pessoas que votaram em Branco no primeiro turno, votam em Branco no segundo turno
O que isto quer dizer?

Em termos reais, Agnelo teve 43.62% dos votos, Roriz teve 28.38% dos votos, Toninho teve 12.84% dos votos e Brancos teve 9.89% dos votos

Isto quer dizer que o percentual esperado de votos no segundo turno é:

  • Agnelo: 43.62*0.95+28.38*0.05+12.84*0.45+9.89*0.16 = 50.22%
  • Roriz: 43.62*0.03+28.38*0.90+12.84*0.19+9.89*0.12 = 30.48%
  • Brancos: 43.62*0.0+28.38*0.01+12.84*0.24+9.89*0.54 = 8.71%
Se contarmos isto dá 89.40% do total - isto quer dizer que há ainda 10.6% não considerados (que podem ir para qualquer lado).

A questão da variável aleatória na Transformada da Incerteza

Como mencionei antes na aplicação da transformada da incerteza para definir cidades e zonas sigma, o problema que não consegui equacionar é a escolha da variável aleatória.

No fundo a questão é: o que define uma tendência na escolha do candidato?

No caso da escolha pelo número da zona isto foi puramente simplicidade. Mas este tipo de simplicidade acaba virando super-simplificação.

A escolha da variável aleatória pela população faz mais sentido, mas só a população não é razão suficiente para definir qual o candidato de preferência. Na realidade, pode ser que até aumente o erro.

Uma possibilidade é o IDH ou renda da região. Uma escolha destas talvez fosse mais significativa do ponto de vista da escolha.

A questão dos pesos é facilmente resolvida: eles são exatamente o percentual de eleitores em relação ao eleitorado total.

Já a questão da escolha da variável aleatória é algo bem mais complexo. Talvez seja o caso de partir de algo menos complicado como a própria definição em uma pesquisa. Assim, algo como perfil de renda ou coisa similar.

Esta é uma questão que precisa ser equacionada

quinta-feira, 14 de outubro de 2010

Algumas mentiras sobre a privatização da telefonia no Brasil

Devo lembrar ainda o problema do anacronismo. Em poucas palavras neste caso é olhar o passado com os olhos de hoje.

Isto é uma falácia lógica primariamente pelo problema da cronologia: a análise feita hoje se beneficia do desenlace do processo. Isto é bem diferente da tomada de decisão enquanto o processo ocorre.

Este tipo de falácia é muito comum. Um exemplo: há os que acreditam que o processo de privatização estava fadado ao sucesso devido a venda ter sido a preço de banana. Ah, mas foi a preço de banana? 18 meses depois e a Telebrás não valeria metade do seu valor de venda (o que aconteceu 18 meses depois? Eu não vou falar, afinal como se pode ser profeta do passado se nem o passado se conhece direito?).

Outra falácia lógica é da evolução tecnológica. Essa é particularmente divertida pois assume uma direcionalidade que na realidade não aconteceu de modo algum. Um exemplo? Em 2001, a tecnologia TDMA ficou em um beco sem saída. Com a decisão da At&T wireless de não prosseguir o caminho evolutivo do TDMA para o 3G, então isto praticamente encerrou o caminho evolutivo do TDMA.

Portanto, nada mais de evolução para 3G a partir do TDMA. Opa, e as operadoras que apostaram no TDMA?

Ora, tiveram que se virar. E torrar uma grana preta para arranjar um caminho evolutivo (que acabou sendo o GSM).

Nada linear como pode ser visto.

Agora vamos fazer o exercício teórico de imaginar que ao invés de operadoras privadas, tivéssemos ainda um sistema estatal.

E aí? Quem é que iria pagar a conta, levar a culpa e ser crucificado em praça pública pela decisão de torrar BILHÕES em um sistema como o TDMA na telefonia celular brasileira.

Ou seja, fácil fazer conjecturas quando se sabe o desenlace e não se sabe todos os percalços que levaram a este desenlace.

Pesquisas e Equívocos 12

A transformada da incerteza pode ser estendida para tratarmos de zonas eleitorais. Aí ao invés de utilizar os dados de todas as zonas eleitorais, poderíamos utilizar "zonas sigma".

Resolvi fazer o teste para o caso de Brasília. Aqui temos 21 zonas com número variado de eleitores. Como peso utilizei o percentual de eleitores comparado ao total. Já como variável aleatória eu tive duas escolhas: na primeira utilizei o número da zona (bastante arbitrário, eu reconheço). Já na segunda eu utilizei o número de eleitores.

Então vamos aos resultados.

No caso de número de eleitores, eu fiz a análise de determinação das zonas importantes com 4 zonas, 5 zonas e 6 zonas. Verifiquei os pesos considerando também os pontos sigma originais.
  • No caso de 4 pontos, as zonas escolhidas foram 7, 16, 13 e 9 (pesos: 0.0431, 0.1786, 0.5164, 0.2619)
  • No caso de 5 pontos, as zonas escolhidas foram 7, 12, 21, 5 e 4 (pesos: 0.0260, 0.1737, 0.4340, 0.2000, 0.1663)
  • No caso de 6 pontos, as zonas escolhidas foram 7, 11, 16, 13, 14 e 4 (pesos: 0.0251, 0.0562, 0.2917, 0.2740, 0.2169, 0.1361)
Os resultados para presidente foram os seguintes:
  • Computo completo:  Marina 41.96%, Serra 24.30%, Dilma 31.74%
  • 4 zonas:  Marina 43.20%, Serra 25.28%, Dilma 29.62%
  • 5 zonas:  Marina 42.32%, Serra 24.82%, Dilma 30.96%
  • 6 zonas:  Marina 43.21%, Serra 24.34%, Dilma 31.72%
Portanto, é possível verificar que o uso das zonas sigma realmente fornece resultados compatíveis com o cômputo completo. Para Brasília, este tipo de informação pode ser bastante útil na definição de pesquisas de boca-de-urna ou mesmo de pesquisas de candidatos.

Uma coisa que está faltando é verificar se este desempenho funciona para o caso da disputa para governador. Como creio que isto é interessante, vou ver o que acontece com 4 pontos.
  • Computo completo: Agnelo 48.41%, Roriz 31.50%, Toninho 14.25%
  • Resultados da 7a zona: Agnelo 56.46%, Roriz 30.39%, Toninho 8.68%
  • Resultados da 9a zona: Agnelo 50.08%, Roriz 26.46%, Toninho 17.23%
  • Resultados da 13a zona: Agnelo 50.51%, Roriz 35.42%, Toninho 9.69%
  • Resultados da 16a zona: Agnelo 50.61%, Roriz 33.00%, Toninho 11.59%
  • Desempenho com zonas sigma: Agnelo 50.67%, Roriz 32.42%, Toninho 11.96%
Nada mal mesmo.

terça-feira, 12 de outubro de 2010

Pesquisas e Equívocos 11

Acho que alguns devem se lembrar de um dos posts em que apliquei a transformada da incerteza para encontrar as cidades sigma em Roraima.

Bem, eu fiz aquilo para a eleição de 2006. E refiz agora para eleição de 2010. E adivinhem:
Chegamos aos seguintes resultados:

  • Resultado final em Roraima (totalizado): Dilma 28.72%, Serra 51.03% e Marina 18.77%
  • Resultado fazendo o cálculo Boa Vista com três cidades (Rorainópolis, Alto Alegre e Normandia) : Dilma 28.21%, Serra 50.44% e Marina 19.90%
  • Resultado fazendo o cálculo Boa Vista com quatro cidades (Rorainópolis, Alto Alegre, Uiramutã e São Luiz): Dilma 27.92%, Serra 50.97% e Marina 19.60%
  • Resultado fazendo o cálculo Boa Vista com cinco cidades (Rorainópolis, Caracaraí, Mucajaí, Pacaraima e São Luiz): Dilma 27.09%, Serra 51.58% e Marina 19.74%
Impressionante, não?
*** POST SCRIPTUM


Para mostrar que não é coincidência, mas uma relação bem definida, eu também aproveito e coloco os resultados do segundo turno de 2006 aqui utilizando a transformada da incerteza e resultados finais. 

Segundo turno de 2006:
  • Resultado final em Roraima: Alckmin 61.494% e Lula 38.506%
  • Resultado fazendo o cálculo Boa Vista com três cidades: Alckmin 62.563% e Lula 37.434%
  • Resultado fazendo o cálculo Boa Vista com quatro cidades: Alckmin 60.871% e Lula 39.129%
  • Resultado fazendo o cálculo Boa Vista com cinco cidades: Alckmin 61.934% e Lula 38.061%
Só para lembrar: estes resultados indicam que ao invés de se fazer pesquisas em todo o estado de Roraima, um resultado razoável pode ser obtido utilizando Boa Vista e mais três, quatro ou cinco cidades.

Naturalmente, esta técnica também pode ser usada em outros estados. Mas francamente dá muito trabalho fazer isto.

sábado, 9 de outubro de 2010

Os números do governo - parte 5

Agora vamos ao salário mínimo real.

O que vemos é que a taxa de aumento do salário no governo Lula foi maior que a taxa de aumento no governo FHC.

Os números do governo - parte 4

Agora vamos para evolução do PIB:
Como se vê, há uma evolução constante, tendo a inclinação de 2001-2003 muito parecida com a 2003-2005

Os números do governo - parte 3

E seguindo com a postagem dos diversos números dos últimos 16 anos, vamos à balança de pagamentos.

Como podemos ver, o balanço de pagamentos foi primariamente positivo ao longo do governo Lula. Isto pode ser visto integrando os dois períodos no tempo.

Os números do governo - parte 2

Agora vamos a questão do desemprego. Os dados são do IPEADATA.
Este gráfico mostra que o desemprego realmente aumentou durante o período FHC, tendo diminuído durante o período Lula. A diminuição não é monotônica e é sujeita a muitas oscilações

Nova pesquisa Datafolha

Segundo a mais recente pesquisa Datafolha a situação para o segundo turno está:

Dilma - 48%
Serra - 41%
Brancos/Nulos - 4%
Indecisos - 7%
Há uma margem de 2% de erro (que duvido que seja precisamente isto). O fato é que com o número de indecisos, a eleição não está totalmente definida. Se os indecisos forem todos para Dilma teremos 57% para Dilma e 43% para Serra. Se forem todos para Serra teremos 50% para Dilma e 50% para Serra.

Como acho improvável que todos os eleitores indecisos decidam ir para Serra então eu diria que muito provavelmente vai dar Dilma com uma vantagem entre 0% (apenas alguns votos a mais) e 14%.

Vamos ver

Os números do governo - parte 1

Cansado de ver "spin" para todos os lados decidi postar os números do governo vindo de fontes confiáveis. Para efeito de comparação, peguei os dados dos governos FHC e Lula. O início do governo Lula é marcado por uma linha vertical vermelha (apropriado? talvez...).

Dívida pública interna:
O que vemos é que a dívida cresceu durante todo o período FHC e Lula. Naturalmente, devido ao crescimento do PIB durante o governo Lula, a relação dívida por PIB diminuiu.

Dívida Pública Externa:
Neste gráfico vemos que a dívida externa vêm diminuindo desde o início do governo Lula,tendo tido alguns saltos de crescimento durante o período FHC e Lula.

sexta-feira, 8 de outubro de 2010

Então o que aconteceu com os votos de Dilma?

Se olharmos os números crus vemos uma queda nos votos esperados de Dilma. Por que isto aconteceu?

Vamos aos números crus (contando brancos e nulos):
  • Dilma - pesquisa 47%, votação 42.85%
  • Serra - pesquisa 29%, votação 29.79%
  • Marina - pesquisa 16%, votação 17.66%
  • Brancos/Nulos - pesquisa 2%, votação 8.64%
  • Indecisos - pesquisa 4%, votação 0%
Se somarmos tudo veremos que teremos 98% nas pesquisas (não estão mostrados os demais candidatos) e 98.94% na votação (não estão mostrados os demais candidatos).

Então temos discrepâncias em três dos seis números. Destes, a discrepância no número de indecisos é fácil de explicar pois eles poderiam ir para qualquer lugar, mas certamente teriam de escolher algo.

A segunda discrepância é no número de brancos/nulos. Mas se somarmos o número de indecisos ao número de brancos/nulos então ficaremos claramente dentro da margem.

Então resta a discrepância de 4.15% na votação de Dilma. Este valor está claramente acima da margem de erro. Enquanto os votos de Serra e Marina estão claramente dentro da faixa de erro.

Então a pesquisa errou? Bem, não necessariamente. Mas certamente a pesquisa de boca-de-urna errou. A mesma predisse para os votos válidos o seguinte cenário:
  • Dilma - de 49% a 53% (teve 46.9%)
  • Serra - de 28% a 32% (teve 32.6%)
  • Marina - de 16% a 20% (teve 19.3%)
O curioso é que a pesquisa de boca-de-urna é feita no dia da eleição (e em geral com eleitores). Não dá para dizer que os resultados de Serra e Marina estejam fora da margem de erro devido ao arredondamento realizado no cálculo dos votos válidos (o erro em estimar o número de votos brancos/nulos pode muito bem atrapalhar os resultados nestes casos).

Mas o caso de Dilma é emblemático: efetivamente a sua votação foi abaixo da esperada pela pesquisa.

O que aconteceu?

Como mostrado no post anterior, este desempenho não dá para ser justificado pelo nível de abstenção.

Então há duas explicações possíveis: Dilma não tinha realmente 47% dos votos OU parte de seus eleitores não decidiram votar nela. A primeira hipótese tem o problema de não explicar porque uma parcela fixa do eleitorado preferia dizer que iria votar em Dilma, mas na realidade não votaria.

A segunda hipótese não explica porque uma parcela das pessoas que votaria em Dilma mudou de idéia na hora H.

Pessoalmente tenho suspeitas que a segunda hipótese faz mais sentido.

quinta-feira, 7 de outubro de 2010

Abstenção

Saiu na folha de São Paulo:


Só abstenção no Nordeste não explica segundo turno



Hipótese aventada por petistas, a abstenção de eleitores na região Nordeste não foi decisiva para a realização de segundo turno.
Ainda que o índice de não comparecimento às urnas na região fosse igual ao de 2006, o mais baixo desde a série histórica iniciada em 1994, Dilma Rousseff (PT) não seria eleita no primeiro turno.
O percentual de eleitores nordestinos que deixou de votar no último domingo foi de 20,4%, o que representa 7,5 milhões de eleitores.
Há quatro anos, quando Lula foi reeleito, a abstenção na região foi de 18,5%.
Se a abstenção neste ano tivesse sido semelhante, o quadro sofreria pouca alteração. Por essa hipótese, mais 726 mil votos seriam contados como válidos.
Se todos eles migrassem apenas para Dilma, hipótese praticamente impossível, ela passaria a ter 47,28% dos votos válidos, insuficiente para derrotar José Serra (PSDB) no primeiro turno.
O Nordeste é considerado de vital importância na definição das eleições e, a exemplo da reeleição de Lula, foi a região onde Dilma teve seu melhor desempenho.
Das 100 cidades onde Dilma teve suas votações mais expressivas proporcionalmente, 92 ficam no Nordeste. Os outros oito são municípios do Amazonas.
Apesar de ter pouca influência no resultado final das eleições de domingo, o índice de abstenção aumentou em todas as cinco regiões, em relação a 2006.
Historicamente, a abstenção no segundo turno é maior do que no primeiro.
Novamente pegando o exemplo das eleições de 2006, a abstenção entre o primeiro e o segundo turno no Nordeste aumentou em 920 mil eleitores.
NULOS E BRANCOS
Os Estados do Nordeste registraram o maior percentual de votos nulos ou brancos para à Presidência neste ano. A média na região foi de 11,19%, ante 10,50% no primeiro turno de 2006.
Todos os Estados da região tiveram média acima de 10%. Dos demais Estados do país, apenas o Rio de Janeiro teve índice similar --10,73%.
A Paraíba foi a campeã no quesito: 13,18% dos eleitores não escolheram nenhum candidatos.


Ou seja: mesmo que a abstenção fosse normal, então a votação de Dilma não seria muito diferente.

Isto quer dizer que a discrepância entre as pesquisas e os resultados tem de ter outra razão.

quarta-feira, 6 de outubro de 2010

Pesquisas versus Votos 5

Bem sabemos que houve discrepância entre as pesquisas e os votos das urnas

Mas quanto foi e aonde foi esta discrepância. Infelizmente, apesar de termos todos os dados das urnas, não temos o mesmo nas pesquisas. Então, vou usar os dados da DATAFOLHA para comparar os resultados.

A primeira informação que devemos ter é que não é possível comparar os votos válidos das urnas com os votos válidos das pesquisas. Por que? A razão é que o cálculo dos votos válidos nas pesquisas assume a retirada do universo amostral dos votos nulos, brancos e não sabe. O problema é que cada um destes elementos possui sua própria margem de erro (que deve ser de 2 pontos percentuais). E esta margem de erro altera tanto o resultado médio quanto a margem de erro do resultado médio.

Em outras palavras: valor esperado da divisão é diferente da divisão dos valores esperados.

Assim temos de transformar os resultados das urnas em dados crus, ou seja, em percentual real sem considerar votos inválidos. Isto é bem simples de fazer (basta multiplicar pelo percentual de votos válidos).

A segunda informação é que a pesquisa contém um número limitado de estados: São Paulo, Rio de Janeiro, Paraná, Rio Grande do Sul, Minas Gerais, Distrito Federal, Pernambuco, Bahia e Ceará. Então a comparação só é possível nestes estados.

Então vamos ao que interessa.

São Paulo

  • Pesquisa - Serra 36%, Dilma, 38%, Marina 18%
  • Votos - Serra 37.64%, Dilma 34.53%, Marina 19.23%

Rio de Janeiro

  • Pesquisa - Serra 22%, Dilma, 44%, Marina 24%
  • Votos - Serra 20.11%, Dilma 39.07%, Marina 28.14%

Rio Grande do Sul
  • Pesquisa - Serra 36%, Dilma, 44%, Marina 10%
  • Votos - Serra 37.67%, Dilma 43.57%, Marina 10.51%

Paraná
  • Pesquisa - Serra 38%, Dilma, 38%, Marina 14%
  • Votos - Serra 41.08%, Dilma 36.41%, Marina 14.88%

Pernambuco
  • Pesquisa - Serra 17%, Dilma, 62%, Marina 14%
  • Votos - Serra 17.93%, Dilma 54.52%, Marina 15.34%

Minas Gerais
  • Pesquisa - Serra 26%, Dilma, 47%, Marina 17%
  • Votos - Serra 28.03%, Dilma 42.80%, Marina 19.36%
Distrito Federal
  • Pesquisa - Serra 23%, Dilma, 32%, Marina 34%
  • Votos - Serra 22.83%, Dilma 29.82%, Marina 39.43%

Bahia
  • Pesquisa - Serra 20%, Dilma, 57%, Marina 14%
  • Votos - Serra 18.74%, Dilma 55.94%, Marina 14.06%

Ceará
  • Pesquisa - Serra 16%, Dilma, 62%, Marina 14%
  • Votos - Serra 14.61%, Dilma 59.23%, Marina 14.61%
Então, o que isto mostra? Bem, há certamente casos em que o erro foi maior que 2%. Mas há casos aonde ele foi bem menor. O melhor modo de quantificar isto é fazer um cálculo do erro por candidato. Para Serra isto deu um desvio de 1.64%, para Dilma de 3.55% e para Marina 2.38%.

O desvio global foi de 2.64%

O que isto significa? O esperado é que este desvio fosse pelo menos a metade. O que significa que na realidade tivemos uma margem real de mais de 5.2% para 95% de confiança (ou 4.3% para 90% de confiança).

Naturalmente muitas discrepâncias podem ser causadas pela margem de erro introduzida pelo voto dos indecisos (o caso do DF é um destes - os valores das pesquisas para Dilma e Serra estão dentro da margem de erro, mas não é o caso de Marina - o que dado o número de indecisos ser de 6% pode muito bem justificar uma alteração no quadro).


Mas o problema com o voto dos indecisos é que ele é postivo, ou seja somente serve para justificar um aumento. Mas o que dizer de uma diminuição?

Este é o caso de Dilma em São Paulo, Rio de Janeiro, Pernambuco e Minas Gerais. Nestes estados, a candidata EFETIVAMENTE perdeu votos. 

segunda-feira, 4 de outubro de 2010

Pesquisas versus Votos 4

Então chegou a hora de ver as diferenças da votação para presidente. O que os institutos disseram:
  • Dilma tem 47% pelo DATAFOLHA (2/10), 47% pelo IBOPE (27/09), 47,5% pelo SENSUS (28/09) e 51% pelo Vox Populi (21/09)
  • Serra tem 29% pelo DATAFOLHA (2/10), 29% pelo IBOPE (27/09), 25,6% pelo SENSUS (28/09) e 24% pelo Vox Populi (21/09)
  • Marina  tem 16% pelo DATAFOLHA (2/10), 16% pelo IBOPE (27/09), 11,6% pelo SENSUS (28/09) e 10% pelo Vox Populi (21/09)
  • Não sabe tem 4% pelo DATAFOLHA (2/10), 4% pelo IBOPE (27/09), 9,5% pelo SENSUS (28/09) e 9% pelo Vox Populi (21/09)
  • Branco/Nulo tem 2% pelo DATAFOLHA (2/10), 3% pelo IBOPE (27/09), 3,6% pelo SENSUS (28/09) e 5% pelo Vox Populi (21/09)
Bem, agora temos o valores obtidos, e mais uma vez tratamos dos votos totais
  • Dilma - 42.85%
  • Serra - 29.79%
  • Marina - 17.66%
  • Plínio - 0.80%
  • Brancos - 3.13%
  • Nulos - 5.51%
Como podemos ver temos discrepâncias além da margem de 2% nas votações de Dilma e Brancos e Nulos. Já na votação de Serra e de Marina, os resultados foram próximos dentro da margem de erro para o Datafolha e o Ibope.
** Em tempo: a abstenção nacional foi muito alta (18.12%). Será que isto teve algum efeito?

Pesquisas versus Votos 3

Agora temos os resultados das eleições em diversos locais. Mais uma vez, é importante verificar a totalização dos votos e não apenas os votos válidos

Nisto temos quanto a eleição para presidente em Brasília:
  • Dilma - pesquisa 32% - votação 31.74% (válidos) e 29.82% (totais)
  • Serra - pesquisa 23% - votação 24,30% (válidos) e 22.83% (totais)
  • Marina - pesquisa 29% - votação 41,96% (válidos) e 39.42% (totais)
  • Plínio - pesquisa 2% - votação 1,65% (válidos)
  • Branco/Nulo - pesquisa 5% - votação 2,17%
  • Não sabe - pesquisa 9% - votação: 3.87%
Conclusão: como a margem é de 3%, os resultados de Dilma, Serra, Plínio e Branco/Nulo estão dentro do esperado. No entanto, os resultados de Marina e Não sabe estão bem distantes (cerca de 10% no de Marina e 5% no de Não sabe).

Já no caso da eleição para governador
  • Agnelo - pesquisa 46% e 43.62% votos totais
  • Roriz - pesquisa 21% e 28.38% votos totais
  • Toninho - pesquisa 13% e 12.84% votos totais
  • Eduardo Brandão - pesquis 3% e 5.08% votos totais
O valor de Roriz foi substancialmente maior que a margem de erro de 3%.

domingo, 3 de outubro de 2010

Pesquisas versus Votos 2

Dentro de mais ou menos uma hora teremos os primeiros resultados (espero eu).

Mas no mesmo espírito anterior, quero registrar a situação da pesquisa para presidente no DF:

  • Dilma - 32%
  • Serra - 23%
  • Marina - 29%
  • Plínio - 2%
  • Branco/Nulo - 5%
  • Não sabe - 9%

Foram entrevistados 1087 pessoas, o que dá uma margem de erro de cerca de 3% - ou seja Dilma e Marina estão tecnicamente empatadas no DF e a soma de Serra+Marina+Plínio é maior que o percentual de Dilma.

Se dependesse do DF haveria segundo turno para presidente.

Pesquisas versus Votos

Chegamos a 3 de outubro de 2010. Mas o que me interessa é como as pesquisas (e os institutos) funcionaram como instrumentos de predição.

Então vamos primeiro ao caso dos presidentes:
  • Dilma tem 47% pelo DATAFOLHA (2/10), 47% pelo IBOPE (27/09), 47,5% pelo SENSUS (28/09) e 51% pelo Vox Populi (21/09)
  • Serra tem 29% pelo DATAFOLHA (2/10), 29% pelo IBOPE (27/09), 25,6% pelo SENSUS (28/09) e 24% pelo Vox Populi (21/09)
  • Marina  tem 16% pelo DATAFOLHA (2/10), 16% pelo IBOPE (27/09), 11,6% pelo SENSUS (28/09) e 10% pelo Vox Populi (21/09)
  • Não sabe tem 4% pelo DATAFOLHA (2/10), 4% pelo IBOPE (27/09), 9,5% pelo SENSUS (28/09) e 9% pelo Vox Populi (21/09)
  • Branco/Nulo tem 2% pelo DATAFOLHA (2/10), 3% pelo IBOPE (27/09), 3,6% pelo SENSUS (28/09) e 5% pelo Vox Populi (21/09)
Agora, vamos aos governadores que estão supostamente eleitos pelas indicações das pesquisas
  • Amazonas - Omar Aziz tem 54% pelo Perspectiva (22/09), 56% pelo Action (15/09) e 53% pelo Ibope (12/09)
  • Espírito Santo - Casagrande tem 64,5% pelo Visão (22/09) e  61% pelo Ibope (09/09)
  • Pará - Simão Jatene tem 53% pelo Ibope (01/10)
  • Pernambuco - Eduardo Campos tem 70% pelo Datafolha (02/10)
  • Rio de Janeiro - Sérgio Cabral tem 59% pelo Datafolha (02/10)
  • Sergipe - Marcelo Déda tem 54% pelo Ibope (01/10)
Além disto, há previsão que eleição termine no primeiro turno para:
  • Acre - Tião Viana com 52% pelo Ibope (01/10)
  • Bahia - Jaques Wagner com 52% pelo Datafolha (02/10)
  • Ceará - Cid Gomes com 52% pelo Datafolha (02/10)
  • DF - Agnelo Queiroz com 46% pelo Datafolha (02/10)
  • Minas Gerais - José Anastasia com 47% pelo Datafolha (02/10)
  • Mato Grosso do Sul - Pucinelli com 51% pelo Ibope (01/10)
  • Rio Grande do Norte - Rosalba Ciarlini com 49% pelo Ibope (01/10)
  • Rio Grande do Sul - Tarso Genro com 48% pelo Datafolha (02/10)
  • São Paulo - Geraldo Alckmin com 50% pelo Datafolha (02/10)
  • Tocantins - Siqueira Campos com 52% pelo Ibope (01/10)
Eu reluto a colocar estes como vencedores no primeiro turno pois há chances que isto não se concretize. O que não deve acontecer no caso anterior.

Bem, vamos ver não?

quarta-feira, 29 de setembro de 2010

E mais uma vez o mundo dá voltas

Leio na internet sobre o julgamento no STF sobre a exigência dos dois documentos na hora da votação.

Como já votei antes e não me lembrava disso, fiquei um pouco curioso. Então cheguei na lei 12.034/2009 que fez a seguinte modificação:


Art. 91-A.  No momento da votação, além da exibição do respectivo título, o eleitor deverá apresentar documento de identificação com fotografia. (Incluído pela Lei nº 12.034, de 2009)
        Parágrafo único.  Fica vedado portar aparelho de telefonia celular, máquinas fotográficas e filmadoras, dentro da cabina de votação. (Incluído pela Lei nº 12.034, de 2009)


Então temos uma lei assinada pelo atual presidente da república que demandou a exigência. Naturalmente, o atual presidente e boa parte do governo é do PT.

Ora, e quem foi que pediu a ADIN? O PT!

Não é muito engraçado?