Teste adaptativo de nivelamento e testagem adaptativa computadorizada (CAT): TRI, calibração de partida a frio e espaços de conhecimento
Resumo executivo
- TRI tem três modelos aninhados: 1PL/Rasch (apenas dificuldade b), 2PL (+ discriminação a), 3PL (+ adivinhação c) [1][2]. Apenas 1PL pode ser calibrado com poucos dados: a pontuação bruta é estatística suficiente para a habilidade, de modo que a dificuldade pode ser estimada sem conhecer a habilidade de ninguém primeiro [2]. 2PL/3PL requerem “centenas” de respostas por item segundo a própria equipe de psicometria da Duolingo [4].
- CAT seleciona o item de máxima informação de Fisher para a habilidade estimada, atualiza por MLE ou EAP/MAP bayesiano, e interrompe por limiar de erro padrão ou número fixo de itens [3].
- Controle de exposição: Sympson-Hetter bloqueia probabilisticamente itens sobreexpostos; “randomesque” escolhe aleatoriamente entre os 5-10 melhores [3][12][13]. Duolingo (2026) substitui o bloqueio por Thompson Sampling, integrando o limite de exposição na própria seleção [5].
- O arranque a frio está nomeado e resolvido em produção: Duolingo distingue cold-start (item sem respostas), jump-start (poucas respostas piloto) e warm-start (recalibração do banco operacional), e calibra itens novos a partir de características de conteúdo (embeddings BERT, frequência lexical) via AutoML, sem aguardar centenas de respostas [4].
- Elo é a alternativa prática: atualiza habilidade e item em O(1) por resposta, sem fase de pilotagem separada; já é o mecanismo recomendado na pesquisa prévia deste projeto (tópico 13, Math Garden) [9].
- ALEKS não usa uma escala única: aplica Knowledge Space Theory, modelando o domínio como subconjuntos factíveis de conceitos com estrutura de pré-requisitos; o resultado é uma posição em um grafo, não um número — o melhor precedente para a árvore de habilidades [7][8].
- O Duolingo English Test (V8) administra 18 itens Y/N de vocabulário + 9 vocabulário em contexto por sessão (27 de 14 tipos totais), de um banco de 3.290 + 585 itens [4].
- A documentação pública do NWEA MAP Growth, i-Ready, Khan Academy e IXL sobre seus algoritmos internos é muito mais escassa que a da Duolingo/ALEKS — confirma apenas que são adaptativos, não as fórmulas [15][16][17].
- Um CAT de apenas 5 itens, repetido, alcançou eficiência comparável a um desenho pré-pós completo em um estudo de 2024 — apoia iniciar curto por tópico em vez de um exame longo global [18].
- Recomendação central: dificuldade experta de 1-100 por item, seleção “mais próximo da dificuldade atual”, atualização Elo com K decrescente, parada aos 10-15 itens ou por estabilidade, e caminho de melhoria rumo a TRI/Rasch calibrado com ≥200-400 respostas por item.
Este documento foi traduzido do original em inglês por Claude (Anthropic) e verificado automaticamente contra a fonte: cada número, URL, marcador de citação e marca [unverified] corresponde ao original. A prosa em si ainda não foi revisada por um editor humano nativo.
Estado de verificação
Este documento não traz nenhuma marca [unverified]. Cada afirmação está ligada a uma fonte numerada abaixo.
[unverified] significa que a afirmação está na pesquisa mas não foi confirmada contra uma fonte primária na sessão que a produziu. É publicada em vez de removida, porque um corpus que esconde suas lacunas não é verificável.
Como esta pesquisa foi produzida
Os 47 documentos foram produzidos em 2026-07-31 por agentes independentes, cada um com instrução de não inventar citações e de marcar como [unverified] o que não pudesse confirmar contra uma fonte primária. A cota de busca na web da sessão se esgotou no meio do caminho e os agentes seguintes trabalharam por download direto de fontes primárias. Vários sites (ftc.gov, ico.org.uk) bloqueiam download automatizado, e por isso certas afirmações jurídicas estão marcadas de propósito.
Isto é pesquisa, não aconselhamento jurídico, médico ou financeiro. Nada aqui reivindica um resultado de aprendizagem do Math Challenge; esse estudo ainda não existe.
Resultados
1. Fundamentos do IRT — três modelos aninhados, um realista para início a frio
p(θ) = c + (1-c)·σ(a(θ-d)) fornece a probabilidade de acerto a partir da habilidade θ e dos parâmetros do item dificuldade d, discriminação a e adivinhação c [1][4]. Fixar c=0, a=1 gera 1PL/Rasch — a dificuldade é o único parâmetro livre do item, e sua propriedade de estatística suficiente permite estimar a dificuldade do item por MLE condicional sem conhecer a habilidade primeiro [2]. 2PL libera a: maior discriminação significa que um item separa de forma mais limpa os testadores logo abaixo da dificuldade daqueles logo acima [1]. 3PL adiciona adivinhação c, apropriado para itens de múltipla escolha (≈0,25 de piso em quatro opções) [1]. Ambos exigem dados por item substancialmente maiores que o Rasch — o padrão na literatura é “centenas” de respostas [1][4].
2. Mecânica do CAT — seleção, estimação, parada, exposição
O loop: estimar θ a partir das respostas até o momento; escolher o item não usado que maximiza a informação de Fisher naquele θ; aplicar; atualizar; repetir [3]. MLE é assintoticamente não tendencioso, mas indefinido para padrões de respostas perfeitas ou nulas; EAP/MAP bayesiano resolve isso via um prior ao custo de um leve viés [3]. Regras de parada: limiar de erro-padrão (comprimento variável), contagem fixa de itens ou limiar de confiança de classificação para decisões de aprovação/reprovação [3]. Sympson-Hetter gera um número aleatório por item candidato contra um parâmetro de exposição específico do item para bloquear probabilisticamente até mesmo o melhor item [3][12]. Randomesque seleciona uniformemente entre os 5-10 itens mais informativos [3]. Estudos comparativos (Ozturk & Dogan 2015; Leroux et al. 2013, 2016) testam esses métodos contra abordagens mais recentes de “erro padrão progressivo-restrito” em modelos 3PL/GPC, geralmente encontrando trade-offs entre precisão e exposição ao invés de um vencedor claro [12][13][14]. O artigo da Duolingo de 2026 S2A3 substitui o bloqueio por Thompson Sampling, tratando limites de exposição como restrições estocásticas dentro da seleção de itens [5]. Balanceamento de conteúdo é a restrição ortogonal que a seleção também deve atender a uma mistura-alvo de conteúdo, não apenas maximizar a informação [3].
3. O problema de início a frio, nomeado e resolvido por um sistema de produção ao vivo
O artigo AutoIRT da Duolingo nomeia exatamente a situação do Math Challenge: cold-start (novo item, sem respostas, calibrado apenas a partir de características de conteúdo), jump-start (pequena amostra piloto combinada com o banco operacional), warm-start (recalibração conforme a população/UI/materiais de preparação mudam) [4]. Sua solução: um ensemble AutoML (random forests, LightGBM, XGBoost, CatBoost) treinado em características de conteúdo dos itens, projetado em parâmetros interpretáveis de IRT via Monte Carlo EM, evitando a necessidade de centenas de respostas ao vivo antes que um item seja utilizável [4]. Isso demonstra que dificuldade provisória derivada de características/experts é um ponto de partida profissional com caminho de upgrade real, não um atalho.
A alternativa compatível com uma equipe pequena é calibração online baseada em Elo: tanto o AutoIRT quanto a literatura mais ampla apontam Elo como um procedimento online de longa data para o modelo Rasch, atualizando avaliações de pessoa e item após cada resposta sem etapa de ajuste offline [4][9]. Um artigo EDM de 2019 (Abdi, Khosravi, Sadiq & Gasevic) estende Elo de conceito único para uma forma multivariada para itens com múltiplas tags, reportando acurácia preditiva aprimorada [10]. O tópico 13 da própria pesquisa deste projeto já recomenda a regra HSHS da Math Garden como precedente concreto: atualizações O(1) (bom ajuste para Durable Objects), validado em aritmética infantil [9]. Um terceiro caminho, em estágio posterior: BOBCAT (Ghosh & Lan, 2021) enquadra a própria seleção de itens como otimização bilevel ao invés de pura informação de Fisher — um upgrade plausível v2/v3 quando houver dados suficientes para treiná-lo [11].
4. ALEKS e Teoria do Espaço de Conhecimento — um grafo, não uma escala
ALEKS surgiu na UC Irvine em 1994 (financiado pela NSF), adquirido pela McGraw-Hill em 2013 [8]. A Teoria do Espaço de Conhecimento (Doignon & Falmagne) modela um domínio como conjunto de conceitos Q; o estado de um aprendiz é um subconjunto factível, limitado por pré-requisitos, não qualquer subconjunto de Q [7]. Isso define uma ordem parcial sobre os estados factíveis. A franja externa é o que o aprendiz está pronto para aprender a seguir (pré-requisitos satisfeitos); a franja interna é o que acabou de ser adquirido [7]. A avaliação do ALEKS reduz qual estado factível o aprendiz ocupa, então recomenda a franja externa — um caminho personalizado através de um grafo de pré-requisitos, não uma pontuação percentílica [7][8]. Esse é o design de referência para uma UI de árvore de habilidades, com IRT/Elo lidando com a ordenação de dificuldade dentro do nó.
5. Duolingo English Test — o CAT mais documentado concretamente em ed-tech
Na versão do DET estudada (V8), cada sessão executa 18 itens de Vocabulário Sim/Não (5 segundos cada, julgando palavras reais vs. palavras falsas geradas algorítmicamente) e 9 itens de Vocabulário em Contexto (20 segundos cada, preenchimento de lacunas) — 27 itens para dois dos 14 tipos de tarefa totais, extraídos de bancos de 3.290 e 585 itens respectivamente [4]. θ está em uma escala contínua Normal de média zero e variância um a priori, com a pontuação reportada como a média a posteriori usando o posterior completo durante a calibração, não uma estimativa pontual [4]. A Duolingo também publicou especificamente sobre IA Responsável para este teste, enquadrando qualidade/equidade como uma cadeia de argumento de validade em andamento (definição de domínio → avaliação → generalização → explicação → extrapolação → utilização) — um checklist útil mesmo fora de testes de admissão de alto risco [6].
6. NWEA, i-Ready, Khan Academy, IXL — detalhes públicos mais escassos
O MAP Growth da NWEA relata uma escala RIT (“Rasch unIT”), independente de série e contínua; o centro de pesquisa da NWEA publica estudos de deriva de parâmetros de itens e validações presumindo uma base IRT/Rasch, mas o algoritmo exato de seleção de itens não foi encontrado em páginas públicas acessíveis nesta pesquisa [15]. Os próprios materiais da Khan Academy descrevem aprendizagem por domínio como o modelo pedagógico, mas a mecânica de “Course challenge” não está detalhada em páginas abertamente acessíveis [16]. A página do produto da IXL afirma claramente que “a dificuldade das questões se adapta automaticamente”, confirmando comportamento semelhante a CAT, sem publicar escala, contagem de itens ou regra de seleção [17]. O manual técnico do i-Ready não foi recuperável nesta sessão; nenhuma alegação específica foi feita além de sua existência como diagnóstico adaptativo. Essa lacuna é, por si só, um achado: as literaturas da Duolingo e do ALEKS/acadêmicas são os projetos utilizáveis para v1; os fornecedores de diagnóstico K-12 tratam os detalhes internos como segredos comerciais.
7. Quantos itens, e por tópico vs. global
Não existe um mínimo universal, mas dois pontos de dados delimitam o intervalo. CATs de alto risco de comprimento fixo costumam chegar a dezenas de itens para atingir um alvo de erro-padrão apertado [3]. Um estudo de 2024 encadeando CATs curtos para o Force Concept Inventory encontrou que administrações adaptativas de 5 itens (9 vezes ao longo de um semestre) alcançaram eficiência “comparável à do método pré-pós” para rastrear mudança — contexto específico (medição formativa repetida, não colocação única), mas evidência de que curtos-e-repetidos podem substituir longos-e-únicos [18]. Isso favorece colocação por tópico (10-15 itens por ramo, conforme o briefing do projeto) em vez de um único teste global: uma criança pode ser posicionada em “aritmética de 3ª série” e “geometria de jardim de infância” simultaneamente, o que um escore global único não pode representar, mas um CAT por tópico e o modelo de espaço de conhecimento do ALEKS conseguem [7].
8. Não parecer um teste para uma criança de 6 anos
Nenhuma fonte revisada aqui aborda UX infantil diretamente, mas dois fatos estruturais se traduzem em restrições. Como o CAT direciona cada item próximo da habilidade real do aprendiz por construção, uma colocação adaptativa bem implementada produz naturalmente uma experiência de sucesso misto em vez de uma parede de falhas — o próprio mecanismo protege a sensação, desde que a UI não editorialize sobre ele (sem contagens regressivas visíveis ou buzinas de resposta errada) [3]. Como a colocação curta e por tópico (§7) é defensável e melhor adaptada ao tempo de atenção de uma criança, pode ser entregue como uma sequência de mini-jogos temáticos curtos ao invés de um exame contínuo — aproveitando o precedente já validado para crianças do Math Garden do tópico 13 ao invés de redefinir o tom aqui [9].
Implicações de design
- Use dificuldade provisória no estilo Rasch (1PL) para v1, não 2PL/3PL. Sem histórico de respostas, apenas um único parâmetro de dificuldade por item é realista; discriminação/chute precisam de dados que v1 não terá [1][2][4].
- Algoritmo: dificuldade marcada por especialistas + seleção da dificuldade mais próxima. Marque manualmente cada item de 1-100. Em cada etapa, selecione o item não usado cuja marcação esteja mais próxima da estimativa atual de habilidade — uma substituta sem parâmetros para a seleção de máxima informação de Fisher [3][4].
- Atualização de habilidade: Elo, não MLE/EAP.
ability += K * (outcome - expected),expecteduma função logística de (ability − item difficulty), correspondendo ao formato de resposta Rasch; O(1) por resposta, cabe em um Durable Object ou em uma gravação D1 por turno, consistente com o precedente do tópico-13 [1][9]. - K decrescente dentro de uma sessão. K grande para os primeiros 3-4 itens (convergência rápida a partir da estimativa baseada na idade), K menor depois (estabilidade) — o análogo dentro da sessão ao período de classificação provisória do Elo no xadrez [9].
- Regra de parada: limite rígido de 15 itens, parada antecipada a partir do item 8 com estabilidade. Interrompa antecipadamente se as últimas 4 respostas alternarem em torno do mesmo nível (±1) sem deriva neta — um proxy para “erro padrão é suficientemente pequeno” sem um modelo calibrado para calcular o erro padrão a partir de [3].
- Alocação por tópico, não pontuação global, correspondendo ao modelo de múltiplos estados do ALEKS e à árvore de habilidades própria do projeto [7][8].
- A idade semeia apenas o item 1; a estimativa de habilidade governa tudo depois. A entrada de idade é um prior, não um teto ou piso — 2-3 respostas devem ser capazes de mover a estimativa um nível completo.
- Registre cada resposta (id do item, dificuldade marcada, resultado) desde o primeiro dia. Isso é exatamente os dados de “início rápido” que a equipe do Duolingo exige antes de qualquer recalibração; sem eles desde o lançamento, a implicação 9 começa tarde [4].
- Caminho de upgrade: reajuste em lote das dificuldades marcadas para um modelo Rasch real em ~200-400 respostas por item, mesclando o prior de especialista com a estimativa empírica ao invés de descartá-lo, já que o volume por item será desigual [4].
- 2PL somente depois que o Rasch estiver estável e o volume for alto (“centenas” de respostas conforme a literatura); ignore completamente os parâmetros de chute 3PL a menos que o formato seja múltipla-escolha de opções fixas, pois o chute não é identificável de outra forma [1][4].
- Controle de exposição somente quando o tráfego supera o pool de itens. Em v1, basta evitar repetir um item dentro de uma sessão; adicione bloqueio estilo Sympson-Hetter ou seleção aleatória top-N apenas quando a telemetria mostrar alguns itens dominando a seleção [3][12].
- UX por faixa etária: idades ~4-6 — mini-jogo guiado por um único personagem, sem pontuação/cronômetro ou linguagem de “teste” visível, feedback comemorativo independentemente da correção, terminando em transição narrativa, não em tela de resultados. Idades ~7-11 — uma “missão de aquecimento” com barra de progresso de contagem de itens (nunca barra de acertos), narrativa leve, ainda sem pontuação numérica exibida. Idades ~12-17 e adulto/experto — enquadramento transparente (“para que possamos iniciar no nível correto”) é adequado e frequentemente preferido, mas ainda evite linguagem de “avaliação da sua habilidade”; um teste adaptativo bem direcionado está realmente mais próximo de prática guiada do que de fazer prova, quando está convergindo corretamente, o que sustenta esse enquadramento em todas as idades [3].
- A idade é um tema e uma semente, nunca um limite rígido de alocação — todo o objetivo de um teste adaptativo, conforme o briefing, é que a habilidade, não a idade, define o nível.
Perguntas abertas para o dono do projeto
- Alocação obrigatória antes de qualquer prática, ou opcional com fallback padrão de idade e ação de “recalibrar” posterior?
- Qual agenda de K para a atualização Elo com K decrescente — fixa (por exemplo, 1,0 / 0,5 / 0,25) ou ajustada empiricamente pós-lançamento a partir dos dados registrados?
- Marcação de dificuldade de itens por um único autor, ou um processo leve de múltiplos avaliadores (2-3 pessoas, reconciliação de divergências) antes de enviar quaisquer itens?
- Cada tópico deve compartilhar um limite de 15 itens, ou ramos amplos (por exemplo, todo o aritmético) devem ter um limite maior que os estreitos (por exemplo, divisão longa)?
- Quando a alocação diverge fortemente da idade declarada (uma criança de 5 anos alocada na 3ª série), exibir claramente, suavizar ou pedir ao responsável que confirme primeiro?
- A re-alocação periódica (a cada N semanas, ou após M respostas erradas no nível atual) é um recurso da v1, ou uma adição posterior após validação do loop central?
- Dada a escassez da documentação pública da NWEA/i-Ready/IXL/Khan Academy, há interesse em buscar seus manuais técnicos sob acordos de dados de pesquisa, ou a base Duolingo/ALEKS/acadêmica aqui é suficiente por enquanto?
Fontes
- Wikipedia — Item response theory
- Wikipedia — Rasch model
- Wikipedia — Computerized adaptive testing
- Sharpnack, J., Mulcaire, P., Bicknell, K., LaFlair, G., & Yancey, K. (2024). AutoIRT: Calibrating Item Response Theory Models with Automated Machine Learning. arXiv:2409.08823
- Sharpnack, J., Tsigler, A., Lockwood, J.R., Nydick, S., & von Davier, A.A. (2026). S2A3: Thompson Sampling and Stochastic Exposure Control for High-Stakes CATs. arXiv:2606.07364
- Burstein, J., LaFlair, G.T., Yancey, K., von Davier, A.A., & Dotan, R. (2024). Responsible AI for Test Equity and Quality: The Duolingo English Test as a Case Study. arXiv:2409.07476
- Wikipedia — Knowledge space
- Wikipedia — ALEKS
- Wikipedia — Elo rating system
- Abdi, S., Khosravi, H., Sadiq, S., & Gasevic, D. (2019). A Multivariate Elo-based Learner Model for Adaptive Educational Systems. Proceedings of the 12th International Conference on Educational Data Mining (EDM 2019)
- Ghosh, A., & Lan, A. (2021). BOBCAT: Bilevel Optimization-Based Computerized Adaptive Testing. arXiv (IJCAI 2021)
- Ozturk, N.B., & Dogan, N. (2015). Investigating Item Exposure Control Methods in Computerized Adaptive Testing. Educational Sciences: Theory and Practice. ERIC EJ1057460
- Leroux, A.J., Lopez, M., Hembry, I., & Dodd, B.G. (2013). A Comparison of Exposure Control Procedures in CATs Using the 3PL Model. Educational and Psychological Measurement. ERIC EJ1019083
- Leroux, A.J., & Dodd, B.G. (2016). A Comparison of Exposure Control Procedures in CATs Using the GPC Model. Journal of Experimental Education
- Wikipedia — NWEA
- Wikipedia — Khan Academy
- IXL — Real-Time Diagnostic product page
- Yasuda, J., Hull, M.M., Mae, N., & Kojima, K. (2024). Chained computerized adaptive testing for the Force Concept Inventory. arXiv
- Math Challenge internal research, topic 13: Intelligent Tutoring Systems and Learner Modelling: BKT, DKT, PFA, and the Math Garden Elo Approach (2026-07-31), docs/research/2026-07-31-mc-13-its-knowledge-tracing-elo.md — the Elo/Math Garden precedent this document builds on rather than re-deriving
Perguntas que este documento deixa em aberto
Ficam sem resposta de propósito. São listadas, não resolvidas — transformá-las em FAQ exigiria inventar respostas que o documento não tem.
- Mandatory placement before any practice, or optional with an age-default fallback and a later "recalibrate" action?
- What K schedule for the decreasing-K Elo update — fixed (e.g., 1.0 / 0.5 / 0.25) or tuned empirically post-launch from logged data?
- Single-author item-difficulty tagging, or a lightweight multi-rater process (2-3 people, reconcile disagreements) before any items ship?
- Should every topic share a 15-item cap, or should broad branches (e.g., all-of-arithmetic) get a longer cap than narrow ones (e.g., long division)?
- When placement disagrees sharply with stated age (a 5-year-old placing at 3rd grade), show it plainly, soften it, or ask the parent to confirm first?
- Is periodic re-placement (every N weeks, or after M wrong answers at the current tier) a v1 feature, or a later addition once the core loop is validated?
- Given how thin NWEA/i-Ready/IXL/Khan Academy's public documentation is, is there appetite to pursue their technical manuals under research-data agreements, or is the Duolingo/ALEKS/academic basis here sufficient for now?
Um de 51 documentos de pesquisa, 168.346 palavras no total, contadas na compilação a partir dos próprios arquivos. Ler este documento no repositório