Math Challenge
Mais

Integridade da avaliação em linha e antifraude: um modelo progressivo para uma aplicação de matemática de consumo

mc-29 · Publicado: · por Math Challenge Research · 3926 palavras · 19 fontes citadas

Resumo executivo

441 palavras

Este documento foi traduzido do original em inglês por Claude (Anthropic) e verificado automaticamente contra a fonte: cada número, URL, marcador de citação e marca [unverified] corresponde ao original. A prosa em si ainda não foi revista por um editor humano nativo.

Estado de verificação

Este documento não traz qualquer marca [unverified]. Cada afirmação está ligada a uma fonte numerada abaixo.

[unverified] significa que a afirmação está na investigação mas não foi confirmada contra uma fonte primária na sessão que a produziu. É publicada em vez de removida, porque um corpus que esconde as suas lacunas não é verificável.

Como esta investigação foi produzida

Os 47 documentos foram produzidos a 2026-07-31 por agentes independentes, cada um com instrução de não inventar citações e de marcar como [unverified] o que não pudesse confirmar contra uma fonte primária. A quota de pesquisa na web da sessão esgotou-se a meio e os agentes seguintes trabalharam por descarregamento directo de fontes primárias. Vários sítios (ftc.gov, ico.org.uk) bloqueiam o descarregamento automatizado, e por isso certas afirmações jurídicas estão marcadas de propósito.

Threat model table

AttackWho does itHow detectableCost to defend
Procurar a resposta (pesquisa, livro‑texto)Qualquer idade/nívelTempo de resposta muito abaixo do tempo de resolução humana mais rápido plausível; correção quase instantânea após inatividade visível/tab‑blurBaixo — piso de tempo de resposta no servidor por item, eventos de visibilidade de aba
Pai/irmão resolve por a criançaPrincipalmente crianças pequenasDesajuste de estilo vs. a linha de tendência de habilidade da contaBaixo‑médio — sinalização baseada em tendência apenas, nunca punitiva nesta idade
Aplicação de resolução / calculadora num segundo dispositivoCrianças mais velhas, adolescentes, adultosPiso de tempo de resposta; um resolvedor devolve quase instantaneamente independentemente da dificuldade, enquanto o tempo humano escala com elaBaixo‑médio — mesmo mecanismo de piso, calibrado por tipo de item
Segundo dispositivo responde enquanto o dispositivo principal é o “cronómetro”Adolescentes, nível competitivoDifícil sem atestação de dispositivo; mitigado estruturalmente ao manter a temporização no servidor, de modo que um segundo dispositivo não ganha vantagem mensurávelMédio — arquitetónico, não um controlo adicional
Partilha de respostas entre amigosQualquer idade, contextos de turmaEstatísticas de similaridade de respostas/colusão (omega, GBT, K‑index); significativo apenas quando o banco de itens é grandeMédio‑alto — requer um banco real mais maquinaria estatística
Scripts/bots automatizados (repetição de API, navegador sem cabeça)Utilizadores técnicos, cultivadores de classificaçãoSinais de gestão de bots (impressão digital comportamental, prova de trabalho, TLS/JA3), limitação de taxa, tokens Turnstile/Privacy PassBaixo‑médio — infraestrutura pronta a usar
Partilha de conta (um login, muitas pessoas)Famílias, nível competitivoDeteção de sessões concorrentes, incompatibilidade de credenciais WebAuthn, descontinuidade de habilidadeMédio — requer rastreamento de sessão/dispositivo
Falhar deliberadamente em conteúdo fácil para melhorar classificação (“sandbagging”)Utilizadores competitivos/da classificaçãoAnomalia de variância vs. histórico próprioMédio — requer uma base de habilidade/rating mantida (já exigida no tópico 18)

Constatações

1. Pontuação autoritativa no servidor e por que o tempo do cliente não pode ser confiável

Um navegador pode ser totalmente inspecionado e modificado pelo próprio utilizador: as DevTools podem pausar a execução, reescrever variáveis, reproduzir pedidos de rede editados e substituir Date.now()/performance.now(). Este é o mesmo modelo de ameaça que tornou obsoletas as arquiteturas multijogador «client‑authoritative» (o cliente reporta a sua própria pontuação/tempo e o servidor simplesmente acredita nele). O servidor tem de registar independentemente o horário em que a questão foi apresentada e a resposta recebida, e verificar independentemente a correção — o cliente apenas renders e collects. Nada mais escala para uma tabela de classificação onde a rapidez atribui pontos, uma vez que a duração reportada pelo cliente é exatamente o que a maioria das recompensas manipula.

2. Estratégia de banco de itens: tamanho, parametrização, randomização, controlo de exposição

A investigação em CAT fornece um manual diretamente aplicável. A exposição de itens — a parte dos candidatos que vê um determinado item — tende a 1 para os itens mais informativos num algoritmo adaptativo ingénuo, o que por si só constitui um problema de segurança: um item apresentado repetidamente torna‑se partilhável [10]. Três mitigações estabelecidas: o método Sympson‑Hetter (sorteia um número aleatório, compara com um parâmetro de exposição por item antes de administrar mesmo o item de melhor ajuste); seleção randomesque/estratificada (escolhe aleatoriamente entre os 5‑10 itens mais informativos, não sempre o único melhor); e shadow testing (van der Linden — constrói um teste hipotético ótimo completo a cada passo para escolhas globalmente, não apenas localmente, ótimas) [10]. Por baixo de todos eles está um grande pool de itens, cultivado economicamente via geração parametrizada/algorítmica de itens (um modelo como a + b = ? com operandos aleatórios por faixa de dificuldade) em vez de itens criados manualmente — explicitamente a forma prática de crescer pools de forma económica segundo a literatura de CAT [10].

3. Deteção estatística: outliers de tempo de resposta

O modelo log‑normal de tempo de resposta de Van der Linden trata os tempos de resposta a itens de uma pessoa como governados por um parâmetro de “velocidade” a nível de pessoa, juntamente com parâmetros de intensidade temporal e discriminação a nível de item, paralelamente à forma como o IRT logístico de dois parâmetros trata a correção [11]. Ajustado, suporta verificações clássicas e bayesianas posterior‑predictivas para aberrância — uma resposta marcadamente mais rápida ou mais lenta do que o previsto — já aplicadas para detetar comportamentos anómalos em testes adaptativos computadorizados [11]. Para o Math Challenge, a versão prática não necessita do modelo completo inicialmente: um piso empírico (“nenhum humano verificado resolve esta classe de itens em menos de X ms”) constitui uma primeira linha de defesa legítima, escalando para o modelo completo apenas em níveis onde os riscos justificam o investimento.

4. Deteção estatística: índices de semelhança de respostas e colusão

A deteção de cópia/colusão de respostas é um sub‑campo psicométrico estabelecido, confirmado via ERIC: o índice ômega (Ω) de Wollack (refinado por Maeda & Zhang 2017; Sunbul & Yormaz 2018), o teste binomial generalizado (GBT) comparado ao ômega para potência/erro Tipo I (Zopluoglu & Davenport, 2012), o K‑index (Holland) versus divergência Kullback‑Leibler (Belov & Armstrong, 2010; Ucar & Dogan, 2021), uma medida KL baseada em tempo de resposta (Man et al., 2018) e um Variable Match Index (Belov, 2011) [12]. Todos partilham uma estrutura: sinalizam quando dois candidatos dão a mesma resposta errada com mais frequência do que o acaso prevê, dado o nível de habilidade individual — uma taxa incomumente alta de respostas incorretas idênticas é a assinatura. Isto só é significativo quando o banco de itens é suficientemente grande para que duas pessoas convergirem ao mesmo item por acaso seja raro.

5. Browsers de lockdown e proctoring remoto — e por que não os usar em crianças

O proctoring remoto baseado em câmara (Proctorio, ExamSoft, Honorlock, Respondus) aumentou durante a COVID‑19 e deixou um rasto documentado de danos e resistência legal:

Conclusão para o Math Challenge: o proctoring com câmara/microfone de crianças não tem lugar neste produto em nenhum nível. Os danos documentados aplicam‑se com maior força a menores do que a adultos universitários envolvidos nesses casos, e nenhuma das condições mitigadoras do tribunal de Amesterdão (necessidade pandémica, capacidade de consentimento adulto, DPIA institucional) existe aqui.

6. Atestação de dispositivos na web em 2026

Leitura prática para um produto PWA‑first: WebAuthn é a única primitiva de ligação a dispositivo realmente disponível em todo o lado; Play Integrity/App Attest são estruturalmente indisponíveis sem aplicações nativas; Private Access Tokens são um bónus real, mas com peso Apple, já integrado no Turnstile.

7. Deteção de bots e limitação de taxa

A pilha de gestão de bots da Cloudflare combina um motor de ML que pontua cada pedido de 1‑99 a partir de características de pedido/cabeçalho/sessão, um motor heurístico que corresponde a impressões digitais conhecidas como maliciosas, e deteção baseada em JavaScript de navegadores headless, refinado por um cookie de sessão (__cf_bm) que suaviza as pontuações para reduzir falsos positivos [18]. O Turnstile é a versão voltada ao consumidor: pequenos desafios JS não interativos (proof‑of‑work, proof‑of‑space, sondagem de APIs web, deteção de peculiaridades do navegador) em vez de um puzzle visual, já tratando tokens Privacy Pass como uma entrada [15][18]. A limitação de taxa nos pontos de submissão/pontuação é a camada complementar mais simples: limitar submissões por conta/IP/janela captura abusos scriptados de alto volume independentemente de qualquer pedido individual parecer humano.

8. Como as plataformas competitivas nomeadas lidam com a trapaça em escala

Implicações de design

Uma escada progressiva concreta de seis níveis. Cada nível apenas adiciona controlos sobre a base autoritária do servidor do nível anterior — nada é removido ao subir, nada acima do nível 0 é jamais empurrado para baixo para o nível de uma criança mais nova.

  1. Tier 0 — Kinder (4-6): temporização/pontuação autoritária do servidor apenas, invisivelmente. O servidor regista independentemente a hora em que a questão é apresentada/resposta recebida e verifica a correção; o cliente nunca controla nenhum dos valores. Sem interface anti‑trapaça visível, sem bloqueio, sem mensagens de trapaça — um pai a resolver ao lado do filho é o caso de uso pretendido, não uma ameaça.
  2. Tier 0 — piso de tempo de resposta, apenas registo. Um tempo mínimo plausível de resolução por tipo de item é registado e registado se ultrapassado, nunca bloqueando ou atribuindo zero. Telemetria pura para calibrar níveis posteriores; aparece apenas num futuro painel de pai/guarda, nunca para a criança.
  3. Tier 1 — Ensino básico inicial (7-9): monitorização silenciosa de variância. O servidor acompanha a tendência de precisão/velocidade de cada aprendiz por competência; um desvio súbito e grande aciona apenas um sinal suave (dificuldade adaptativa ligeiramente mais cautelosa) — nunca um bloqueio, aviso ou penalização visível.
  4. Tier 1 — limitação de taxa nos pontos de submissão. Limites básicos de submissão por conta/IP (infraestrutura partilhada) protegem o backend contra abuso scriptado a partir deste nível.
  5. Tier 2 — Ensino básico tardio/ensino secundário (10-13): o piso de tempo de resposta torna‑se um sinal ativo e suave. Ultrapassar o piso aciona um momento amigável na interface (“foi rápido — queres rever?”) em vez de um registo silencioso; violações repetidas reduzem a confiança na estimativa de domínio, nunca anulam pontos. Ainda sem bloqueio, sem supervisão, sem alarme parental.
  6. Tier 2 — a randomização do banco de itens começa a ser relevante. A geração parametrizada de itens (operandos aleatórios por faixa de dificuldade) torna‑se o mecanismo de entrega predefinido, pois esta é a faixa etária em que um irmão ou colega de turma primeiro tem incentivo para repassar um conjunto de problemas exato.
  7. Tier 3 — Ensino secundário/adolescente geral (14-17): Turnstile + vinculação de dispositivo WebAuthn apenas em ações da tabela de classificação. Turnstile protege os pontos de submissão que afetam a tabela de classificação (invisível por predefinição); as credenciais de dispositivo WebAuthn são introduzidas para reconhecimento da conta, não como requisito de início de sessão — sinalizando “um terceiro dispositivo novo esta semana” como uma entrada, nunca como única barreira.
  8. Tier 3 — ativam‑se as estatísticas de tempo de resposta e semelhança de respostas, apenas no âmbito da tabela de classificação. Quando o banco de itens é suficientemente grande (Finding 4), o servidor executa uma simples verificação de outlier de tempo de resposta (Finding 3) e, onde as contas partilham itens comuns suficientes, uma verificação de semelhança de respostas modelada nos índices publicados — limitada à atividade da tabela de classificação, não à prática ordinária.
  9. Tier 4 — Avançado/pré‑competitivo (16+, optado por jogo classificado): controlo total de exposição de itens. A limitação de exposição ao estilo Sympson‑Hetter (Finding 2) limita a frequência com que até o próximo item mais adequado é mostrado a utilizadores de habilidade semelhante, protegendo o vetor de partilha “todos neste nível recebem o mesmo próximo problema” que passa a importar quando existem apostas reais.
  10. Tier 4 — as heurísticas de partilha de sessão/conta tornam‑se ativas, não apenas registadas. A deteção de sessões concorrentes e os indicadores de descontinuidade de competência agora aumentam ativamente a volatilidade/rating RD (como faria uma conta nova suspeita), em vez de apenas aparecerem num painel.
  11. Tier 5 — Nível superior competitivo/ elegível a bolsas (opt‑in, apostas explícitas, consentimento de guardião quando um menor está envolvido): o conjunto completo de estatísticas, ainda sem câmaras. A maquinaria psicométrica publicada (deteção de colusão ao estilo omega/GBT, o modelo de tempo de resposta log‑normal mais completo) justifica o seu custo aqui, pois o banco é grande e as apostas são altas. Mesmo neste patamar a resposta é mais estatísticas, nunca uma webcam, navegador de bloqueio ou captura biométrica — o registo da Finding 5 não apresenta nenhum cenário em que a supervisão por câmara/biométrica de um menor, ou de um adulto sem mandato institucional, seja defensável.
  12. Server-side vs. client-side, em todos os níveis, sem exceção. Lado do cliente, sempre: renderizar o problema, recolher a resposta, feedback da interface local. Lado do servidor, sempre, a partir do nível 0: o par de timestamps, a verificação de correção, a pontuação e (a partir do nível 3) todos os sinais estatísticos nas Findings 3‑4 e 7. A autoridade de temporização/correção nunca passa para o cliente em nenhum nível — a escada é progressiva nas apostas, não na confiança no cliente, que nunca é concedida.
  13. O que nunca faremos deliberadamente a uma criança, em qualquer nível. Nenhuma captura de webcam ou microfone. Nenhuma recolha de dados biométricos (rosto, voz, dinâmica de teclas, rastreio de olhar). Nenhum navegador de bloqueio. Nenhum supervisor humano remoto. Nenhuma penalização de pontuação ou ação de conta visível a uma criança abaixo do Tier 3 — abaixo do Tier 3, os sinais são telemetria de calibração e, no máximo, um item do painel de pai/guarda. Nenhuma formulação punitiva (“foste apanhado a trapacear”) em lado nenhum — o pior resultado visível em qualquer nível é uma estimativa de domínio com menor confiança ou um prompt amigável, correspondendo ao design decidido: a anti‑trapaça permanece quase invisível para crianças pequenas e só se aperta com o aumento das apostas.

Questões abertas para o proprietário do projeto

  1. Em que idade/nível, se houver, o painel parental deve apresentar sinais de anomalia (Níveis 1‑2) — e deve alguma vez ser visível para a criança, mesmo indiretamente?
  2. O Math Challenge realizará algum evento com apostas reais (bolsa de estudo, prémio em dinheiro, competição reconhecida pela escola) que justifique o conjunto completo de estatísticas do Tier 5, ou o “nível competitivo” significa apenas direitos de exibição na tabela de classificação?
  3. A adoção de WebAuthn/passkey deve ser alguma vez obrigatória, ou sempre opcional, dado que é o único primitivo universal de vinculação de dispositivo mas acrescenta atrito à conta de uma criança pequena?
  4. Para a partilha legítima de conta familiar (pai e filho numa única sessão), como as heurísticas de sessão do Tier 4+ devem evitar sinalizar erroneamente a troca normal de dispositivos familiares como suspeita?
  5. Existe interesse em publicar uma declaração de confiança/segurança de que o Math Challenge nunca usará supervisão por webcam/biométrica, como diferencial em relação a produtos ao estilo Proctorio e como sinal de confiança para os pais?

Fontes

  1. Codeforces rating system documentation and community writeups on performance-relative rating (see also Math Challenge topic 18 research, docs/research/2026-07-31-mc-18-leaderboards-competition.md, Finding 6)
  2. Chess.com, "Chess.com Fair Play and Cheat Detection."
  3. Ogletree v. Cleveland State University, N.D. Ohio (2022) — Fourth Amendment ruling on mandated webcam room scans during remote exam proctoring (cited via secondary summaries; verify primary docket before citing in a public-facing document)
  4. Wikipedia, "Proctorio" — University of Twente research finding cheating-detection sensitivity "very close to zero," documented data breaches, algorithmic-discrimination concerns, BIPA class-action history
  5. Rechtbank Amsterdam, ECLI:NL:RBAMS:2020:2917 (11 June 2020) — Central/Faculty Student Councils of the University of Amsterdam v. University of Amsterdam
  6. U-Today / DUB coverage confirming UvA was permitted to continue online exam surveillance following the June 2020 ruling (search-result snippet; re-verify original article before citing standalone)
  7. Wikipedia, "Academic dishonesty" — proctoring-effectiveness limits framing cheating detection as inherently incomplete
  8. Cloudflare, Bot Score / Bot Management documentation
  9. Cloudflare Turnstile overview
  10. Wikipedia, "Computerized adaptive testing" — item exposure control (Sympson-Hetter, randomesque/stratified selection, van der Linden's shadow testing), large item pools and automatic item generation
  11. Van der Linden, W. J., "A Lognormal Model for Response Times on Test Items,"
  12. ERIC search results confirming published answer-copying/collusion detection statistics: Wollack's omega index (Maeda & Zhang 2017; Sunbul & Yormaz 2018), the generalized binomial test (Zopluoglu & Davenport 2012), the K-index and Kullback-Leibler divergence comparison (Belov & Armstrong 2010; Ucar & Dogan 2021), response-time-based KL divergence (Man et al. 2018), and the Variable Match Index (Belov 2011)
  13. Illinois BIPA litigation against Proctorio alleging unauthorized biometric collection; BIPA statutory damages ($1,000 negligent / $5,000 intentional per violation) (search-result summary; primary docket not directly retrieved — re-verify before citing as settled outcome)
  14. Apple Developer documentation on Private Access Tokens (Privacy Pass implementation) for iOS 16+/macOS Ventura+
  15. Cloudflare Privacy Pass documentation
  16. MDN Web Docs, "Web Authentication API (WebAuthn)."
  17. Android Developers, "Play Integrity API" — native-Android-only scope, explicit non-coverage of web apps/PWAs
  18. Cloudflare Turnstile and Bot Management documentation (combined)
  19. Duolingo leaderboard/XP-farming cheating and detection response, per community and secondary reporting: Reddit (e.g

Perguntas que este documento deixa em aberto

Ficam sem resposta de propósito. São listadas, não resolvidas — transformá-las numa FAQ exigiria inventar respostas que o documento não tem.

Um de 51 documentos de investigação, 168 346 palavras no total, contadas na compilação a partir dos próprios ficheiros. Ler este documento no repositório