Math Challenge
Mais

Projetando desafios matemáticos envolventes e pedagogicamente sólidos: tradições de tarefas ricas, formatos de item e padrões

mc-36 · Publicado: · por Math Challenge Research · 5.713 palavras · 20 fontes citadas

Resumo executivo

508 palavras

Este documento foi traduzido do original em inglês por Claude (Anthropic) e verificado automaticamente contra a fonte: cada número, URL, marcador de citação e marca [unverified] corresponde ao original. A prosa em si ainda não foi revisada por um editor humano nativo.

Estado de verificação

Este documento não traz nenhuma marca [unverified]. Cada afirmação está ligada a uma fonte numerada abaixo.

[unverified] significa que a afirmação está na pesquisa mas não foi confirmada contra uma fonte primária na sessão que a produziu. É publicada em vez de removida, porque um corpus que esconde suas lacunas não é verificável.

Como esta pesquisa foi produzida

Os 47 documentos foram produzidos em 2026-07-31 por agentes independentes, cada um com instrução de não inventar citações e de marcar como [unverified] o que não pudesse confirmar contra uma fonte primária. A cota de busca na web da sessão se esgotou no meio do caminho e os agentes seguintes trabalharam por download direto de fontes primárias. Vários sites (ftc.gov, ico.org.uk) bloqueiam download automatizado, e por isso certas afirmações jurídicas estão marcadas de propósito.

Resultados

1. Design de tarefa rica: piso baixo, teto alto, paredes largas

A expressão “piso baixo, teto alto” tem origem no trabalho construtivista de Seymour Papert e foi ampliada com “paredes largas” por Mitchel Resnick para descrever ferramentas criativas (como o Scratch) que permitem que qualquer pessoa comece facilmente, que especialistas avancem muito e que suportem muitos caminhos e estilos de trabalho diferentes, em vez de uma única rota correta. O NRICH (Universidade de Cambridge) adotou essa tríade como sua definição de “tarefa rica”: piso baixo para que todo estudante tenha um ponto de entrada, teto alto para que estudantes avançados ainda sejam desafiados, e paredes largas para que a tarefa suporte múltiplas representações e estratégias de solução, não apenas múltiplas respostas finais [20]. Isso é distinto e mais forte que “dificuldade diferenciada” — paredes largas significa especificamente que a própria matemática se ramifica (por exemplo, uma tarefa resolvível por desenho, por uma tabela, por álgebra ou por um argumento recursivo), não apenas que existam versões mais fáceis e mais difíceis do mesmo procedimento.

Um arcabouço complementar, mais mecanicamente verificável, se sobrepõe: os níveis de demanda cognitiva de Stein e Smith distinguem “procedimentos com conexões” (um procedimento usado para construir sentido, conectado a conceitos subjacentes, representado de múltiplas formas, exigindo algum esforço) de “fazer matemática” (não algorítmico, exploratório, exigindo autorregulação, com ambiguidade real no caminho da solução) — e os critérios de “tarefa digna de grupo” de Cohen e colegas acrescentam: centra-se em uma ideia matemática importante, tem múltiplos pontos de entrada e estratégias, requer explicação/justificação e minimiza ruído não-matemático que permitiria ao estudante ter sucesso sem envolver a matemática [20]. Juntos, esses elementos fornecem ao Math Challenge um rubrica que pode ser aplicada a qualquer item elaborado, independentemente do tópico: ele tem um ponto de entrada genuíno para um estudante com dificuldade, espaço genuíno para extensão para um estudante forte e mais de uma forma legítima de abordá-lo.

2. Matemática de três atos e o problema do pseudoconteúdo

A estrutura de “matemática de três atos” de Dan Meyer responde a um modo de falha específico dos problemas de palavra tradicionais: matemática presa a um cenário que o estudante nunca precisou realmente para entender (“pseudoconteúdo”). O Primeiro Ato apresenta uma imagem intrigante ou um vídeo curto sem números e sem pergunta explícita — o objetivo é que a própria curiosidade do estudante gere a questão. O Segundo Ato fornece apenas os dados ou ferramentas que os estudantes identificam como necessários, de modo que o trabalho matemático seja intencional e não imposto. O Terceiro Ato revela o resultado real, permitindo que os estudantes confrontem seu raciocínio com a realidade em vez de com uma chave de respostas [1]. Meyer formula o benefício explicitamente: após a matemática, o estudante deve sentir-se mais poderoso — capaz de prever ou explicar algo que antes não podia — em vez de ter completado um exercício designado. Para o Math Challenge, isso sugere um pequeno nível de itens de alto custo de produção (vídeo ou imagem, um Primeiro Ato por unidade) acima de um nível muito maior de itens mais baratos e perfurados, em vez de tentar aplicar três atos a cada item de um banco de 2.500 itens.

3. Gêneros de tarefa do Shell Centre / Malcolm Swan

O Mathematics Assessment Project (Shell Centre, Universidade de Nottingham, dirigido em sua fase final por Malcolm Swan) produziu cerca de 100 lições formativas “Classroom Challenge” que abrangem do 6.º ano até a preparação para a universidade, divididas amplamente em duas categorias: lições de Desenvolvimento de Conceito, que revelam e refinam a compreensão de uma ideia matemática, e lições de Resolução de Problemas, que focam em problemas não rotineiros e envolvem ciclos de estudantes produzindo uma solução, recebendo feedback estruturado (frequentemente via trabalhos de amostra de estudantes) e revisando [7][8]. A própria estrutura teórica de Swan vai além, identificando cinco propósitos distintos que a instrução matemática pode servir — fluência em fatos/habilidades, interpretação de conceitos e representações, desenvolvimento de estratégias de investigação e resolução de problemas, consciência dos valores do sistema educacional e apreciação do poder da matemática na sociedade — e argumenta que o design de tarefa deve seguir deliberadamente o propósito pretendido, pois diferentes propósitos implicam diferentes teorias de aprendizagem e, portanto, diferentes formas de tarefa [9]. Ele descreve ainda cinco tipos de tarefa que apoiam especificamente o desenvolvimento de conceito: classificar objetos, interpretar múltiplas representações, avaliar enunciados matemáticos, criar problemas e analisar raciocínios ou soluções [9]. Isso pode ser reutilizado diretamente como uma taxonomia de rotulagem de itens: todo item do Math Challenge pode ser marcado não apenas por tópico e dificuldade, mas por qual desses cinco propósitos ele atende, o que, por sua vez, deve influenciar seu formato (itens de fluência cabem em MCQ ou entrada numérica rápida; “avaliar um enunciado” se presta a verdadeiro/falso com justificação ou identificar erro; “criar um problema” se presta a resposta aberta ou formato de proposição de problema).

4. Problemas Open Middle

O formato Open Middle de Robert Kaplinsky é definido por três propriedades estruturais: um início fechado (todos os estudantes começam com a mesma informação dada), um fim fechado (há uma resposta final correta, ou uma resposta ótima entre várias válidas) e um meio aberto (existem múltiplos caminhos legítimos para chegar lá) [2]. Isso difere de uma tarefa totalmente aberta porque mantém uma resposta-alvo inequívoca e verificável por máquina — o que é crucial para um produto auto-avaliado — ao mesmo tempo que exige raciocínio matemático genuíno em vez de lembrança de um passo único, pois o “meio” (a busca por posicionamento de dígitos, escolhas de fatores ou combinações ótimas) é onde reside o trabalho cognitivo. Um exemplo canônico: “Usando os dígitos de 1–9 no máximo uma vez cada, preencha as caixas para criar o menor produto possível” — trivially auto-avaliável (compara-se o produto dos dígitos submetidos ao mínimo conhecido), mas resistente a adivinhações porque não há atalho para a resposta além de raciocinar sobre valor posicional e tamanho dos fatores. Problemas Open Middle têm um viés de otimização (“encontre o menor/maior/todos os possíveis”) em vez de um passo único, e Kaplinsky observa que eles ocupam um ponto médio de esforço de design: mais elaborados que um simples exercício de fluência, mas muito menos elaborados que uma tarefa de desempenho de vários dias [2].

5. Rotinas curtas e reutilizáveis em sala: WODB, Padrões Visuais, Conversas Numéricas

Três formatos de “rotina” amplamente adotados são notáveis porque são extremamente baratos de produzir em massa e traduzem quase diretamente para modelos digitais de itens. Which One Doesn’t Belong (WODB), criado por Mary Bourassa em 2014 após adaptar uma atividade de classificação infantil para uma aula de cálculo, apresenta quatro itens (números, formas, gráficos, equações) em uma grade e pergunta qual não pertence — deliberadamente sem resposta única, já que o objetivo é que cada um dos quatro itens possa ser justificado como o “fora de lugar” por um motivo matemático válido diferente [3]. A heurística de design de Bourassa: um WODB forte tem três itens compartilhando uma característica que o quarto não tem, para ao menos uma partição razoável dos quatro — ou seja, múltiplas partições diferentes devem ser todas defensáveis [4]. Como o WODB não tem resposta única, não é naturalmente auto-avaliável em termos de pontuação, mas funciona bem como um formato “selecione seu item e justifique” pontuado pela qualidade/validade da razão apresentada, ou como um item de aquecimento/discussão não pontuado.

Padrões Visuais (Fawn Nguyen) apresenta uma sequência de figuras (passo 1, 2, 3…) que crescem segundo uma regra visível, e pede que os estudantes prevejam um passo distante (por exemplo, passo 43) ou produzam uma equação geral — treinando exatamente a passagem da observação de padrão concreto para a generalização algébrica [10]. Isso é altamente parametrizável: um único “gerador de padrão de crescimento” (regras lineares, quadráticas ou geométricas aplicadas a arranjos de pontos ou ladrilhos) pode produzir mecanicamente grande número de itens isomórficos que diferem apenas na regra específica e no número do passo solicitado.

Conversas Numéricas (amplamente associadas a Ruth Parker, Kathy Richardson e popularizadas por Sherry Parrish e Jo Boaler) é uma rotina curta diária centrada na resolução mental de um único cálculo, seguida de compartilhamento e comparação de diferentes estratégias mentais válidas para o mesmo problema — o ponto não é a resposta, mas a variedade visível de caminhos corretos de raciocínio. Isso se adapta naturalmente a um formato digital “mostre sua estratégia” ou “associe seu método a um nome”, em vez de um simples item de entrada numérica, já que a carga pedagógica está na comparação de métodos, ecoando o tipo de tarefa “avaliar/comparar representações” de Swan [9].

6. Problemas de estimativa de Fermi

Problemas de Fermi — nomeados pela característica capacidade de Enrico Fermi de produzir estimativas de ordem de grandeza precisas a partir de dados mínimos, ilustrada por sua famosa estimativa feita na hora do teste Trinity sobre o rendimento explosivo a partir da distância que pedaços de papel foram soprados — são tarefas de estimativa sem dados exatos prontamente disponíveis, resolvidas ao decompor a quantidade em uma cadeia de fatores aproximadamente estimados [13]. Como os erros nas estimativas individuais tendem a se cancelar parcialmente quando multiplicados, o produto de várias suposições grosseiras costuma estar surpreendentemente próximo da verdadeira ordem de grandeza mesmo quando nenhum palpite isolado foi muito preciso [13]. Pedagogicamente, isso treina o conforto com a incerteza, o raciocínio dimensional e a verificação de sanidade de um grande resultado calculado contra a intuição — e corresponde a um formato de item específico: entrada numérica pontuada como correta dentro de uma banda de tolerância de ordem de grandeza (ou porcentagem), não uma correspondência exata, o que representa um contrato de avaliação fundamentalmente diferente da maioria das aritméticas escolares.

7. Formulação de problemas e a “suspensão da construção de sentido” em problemas verbais

Um ramo separado de pesquisa examina a lacuna entre executar um procedimento corretamente e conectar esse procedimento ao significado de uma situação realista. Achados gerais nessa área (surveyed in overviews of word-problem pedagogy) observam que a dificuldade de compreensão em problemas verbais costuma não ser que os estudantes não consigam executar a aritmética, mas que lhes falta uma conexão firme entre as operações matemáticas e a semântica do cenário realista que o problema descreve [14] — os estudantes podem calcular corretamente enquanto efetivamente “desligam” se o número resultante faz sentido no mundo que o problema descreve (o gênero amplamente citado de itens de teste onde os estudantes dividem pessoas restantes em “ônibus necessários” ou similar sem verificar se a resposta numérica é sequer fisicamente plausível ilustra o mesmo fenômeno). Esse é o mesmo modo de falha que três-act math e Open Middle combatem a partir de ângulos diferentes: três-act math impede isso ao tornar as apostas do mundo real concretas e geradas pelos estudantes antes que qualquer número apareça [1]; Open Middle impede ao tornar o “meio” em si a tarefa de raciocínio, de modo que não há procedimento a ser executado cegamente [2]. Para Math Challenge, a versão acionável dessa pesquisa é uma regra de design: qualquer item de problema verbal deve ser verificável quanto a se uma resposta “plausível porém sem sentido” (tempo negativo, pessoas fracionárias, uma área maior que a forma que a contém) é um erro comum o bastante para justificar um distrator dedicado “essa resposta faz sentido?” ou um prompt de reflexão pós-resposta.

8. Anatomia de um bom item de múltipla escolha e distractores baseados em concepções errôneas

Diretrizes padrão de escrita de itens tratam a construção de distractores como engenharia deliberada: distractores são escritos para serem “plausíveis porém claramente incorretos”, e a atração inicial do estudante por uma opção errada deve vir da plausibilidade superficial que o autor do item inseriu de propósito, não de uma opção implausível que ninguém escolheria (por exemplo, “Detroit” como distractor em uma questão sobre cidades indianas é um exemplo clássico de distractor ruim e não-plausível). Uma fraqueza conhecida do formato é a “test-wiseness” — pistas na construção das opções (comprimento, adequação gramatical, qualificadores absolutos) que permitem a um estudante experiente em testes pontuar acima de seu conhecimento real, o que justifica manter o comprimento/estilo/gramática dos distractores uniformes entre as opções. Os distractores mais fortes e defensáveis não são números aleatórios errados, mas a saída numérica ou simbólica real de uma concepção errônea documentada — por exemplo, para “-2 - (-5)”, oferecer “-7” (erro de sinal na subtração) e “-3” (ignora a negação) como distractores, em vez de números errados arbitrários — porque um distractor construído a partir de um bug real é diagnóstico (qual resposta errada foi escolhida indica qual concepção errônea está presente), enquanto um número errado arbitrário apenas indica que o estudante errou, não como.

9. Formatos de item além da múltipla escolha

Um catálogo de trabalho útil para Math Challenge (desenvolvido em detalhe na tabela Catálogo de Formatos de Item abaixo) inclui: entrada numérica com banda de tolerância (necessária para estimativas ao estilo Fermi e qualquer resposta com arredondamento legítimo); arrastar-para-ordenar (sequenciar passos de uma prova, ou ordenar números/fracionários em uma linha); correspondência (parear uma expressão com seu gráfico, ou um termo com sua definição); hotspot/selecionar-ponto ou clicar-na-figura (identificar uma região, ângulo ou ponto em um diagrama); construir-um-gráfico (colocar pontos, desenhar uma linha de inclinação dada, plotar uma função) — suportado nativamente como graphicGapMatchInteraction, selectPointInteraction, positionObjectInteraction e drawingInteraction na especificação QTI 3.0 [6]; preencher-o-espaço de equação (gap-fill parametrizado dentro de uma expressão simbólica, gapMatchInteraction/textEntryInteraction em termos QTI) [6]; ordenar-em-categorias (classificar uma lista de números/formas em baldes — uma digitalização natural da tarefa “classificar objetos” de Swan) [9]; detectar-o-erro (apresentar uma solução trabalhada com um bug inserido e pedir ao estudante que o localize/nomeie — implementa diretamente o estilo IES “usar problemas resolvidos, inclusive incorretos”); estimativa-com-faixa (entrada numérica pontuada por contenção em um intervalo, o formato natural de problema de Fermi) [13]; seleção-múltipla ( choiceInteraction do QTI com maxChoices > 1) [6]; e manipuláveis interativos (arrastar peças/contadores, peças virtuais de tangram, blocos virtuais de base-dez) [16].

10. Tradições de quebra-cabeças: japonês, chinês, russo, védico

Tradições de quebra-cabeças japonesas oferecem vários formatos já comprovados em escala com milhões de solucionadores. Kakuro (“Cross Sums”), apesar de seu nome japonês, foi realmente inventado em 1966 pelo canadense Jacob E. Funk na Dell Magazines e depois ganhou popularidade duradoura no Japão; requer preencher uma grade de modo que cada corrida horizontal/vertical de células brancas some a uma pista dada sem repetir dígitos, exercitando o raciocínio combinatório sobre quais conjuntos de dígitos podem produzir uma soma-alvo [11]. KenKen, inventado em 2004 pelo professor japonês Tetsuya Miyamoto explicitamente como uma ferramenta de treinamento cerebral “sem instruções”, combina uma restrição de quadrado-latino (cada dígito uma vez por linha/coluna) com regiões “gaiola” que devem produzir um valor-alvo sob uma operação aritmética declarada, e é relatado em uso por mais de 30.000 professores dos EUA para prática de fluência aritmética e dedução lógica [12]. O “labirinto de área” (menseki meiro) de Naoki Inaba — grades de retângulos aninhados com alguns comprimentos de lado e áreas fornecidos, outros a serem encontrados usando apenas aritmética e insight geométrico, sem álgebra ou calculadora — é outro gênero japonês bem-conhecido nessa mesma família, embora este relatório não tenha conseguido verificar uma fonte primária citável para esse formato específico durante esta passagem de pesquisa e o inclua aqui como contexto de fundo em vez de um achado citado.

Tradições chinesas contribuem com o tangram (七巧板, “sete tábuas de habilidade”), um quebra-cabeça de dissecação de sete peças planas (cinco triângulos, um quadrado, um paralelogramo) que se recombinam em um quadrado ou inúmeras outras silhuetas, usado pedagogicamente para desenvolver visualização espacial, congruência e intuição de conservação de área (já que todas as figuras de tangram compartilham a mesma área total) [16]. Os Nove Capítulos sobre a Arte Matemática (九章算术), o texto clássico fundacional da matemática chinesa, está organizado em nove capítulos temáticos (áreas de campo e frações, troca proporcional, distribuição proporcional, extração de raiz de área/volume, volumes de construção, problemas de proporção estilo tributação, sistemas de duas equações lineares via “excesso e déficit”, sistemas lineares gerais via métodos semelhantes à eliminação de Gauss, e problemas de triângulo retângulo/pitagóricos), cada um seguindo um formato estrito “problema, depois solução, depois método” — uma estrutura diretamente reutilizável como modelo de autoria de itens (exemplo trabalhado → método generalizável) [15].

Círculos matemáticos russos (kruzhok), que remontam à Bulgária antes de 1907 e foram formalizados na URSS na década de 1930, são grupos voluntários, não curriculares, de resolução de problemas construídos em torno do desejo genuíno de estar ali e de um contexto social para desfrutar a matemática, tipicamente socráticos e guiados pela exploração ao invés de palestra, às vezes orientados para olimpíadas e às vezes deliberadamente não. A tradição chegou aos EUA em 1994 via Robert e Ellen Kaplan em Harvard, trazida por emigrantes que haviam participado como adolescentes [18]. O gênero de problema de círculo matemático (autocontido, elegante, exigindo insight ao invés de procedimento memorizado) é uma forte fonte de itens de “parede larga” de alto teto, distintos de exercícios alinhados ao currículo.

Matemática védica requer um aviso: o livro de 1965 de Bharati Krishna Tirtha apresenta 16 “sutras” (por exemplo, atalhos para quadrar números terminados em 5, ou padrões específicos de multiplicação) alegados como extraídos do antigo Atharvaveda, mas essa atribuição é rejeitada por historiadores da matemática (S. G. Dani, Kim Plofker, K. S. Shukla), que constatam que o estilo linguístico é sânscrito moderno, as técnicas dependem de notação decimal desconhecida no período védico, e o conteúdo tem essencialmente nada em comum com a matemática real da era védica [17]. Os atalhos de cálculo individuais ainda podem ser legítimos, truques aritméticos úteis a serem incluídos como categoria de item “técnica de velocidade”, mas qualquer enquadramento voltado ao usuário deve evitar apresentá-los como escritura antiga autêntica, tanto porque é factual-mente contestado quanto porque (conforme a fonte encontrada) o enquadramento tornou-se politicamente controverso nos debates curriculares da Índia [17].

11. Parameterized item templates vs. handwritten items

Automatic Item Generation (AIG) é a disciplina formal por trás de transformar um “modelo de item” criado manualmente em muitos itens entregues. O vocabulário padrão: radicais são as características estruturais de um modelo de item que determinam sua dificuldade (por exemplo, número de etapas, tamanho dos números, presença de um recurso que dispara distrações); incidentais são características superficiais que variam sem mudar a dificuldade (quais números específicos, nomes ou história de fundo são usados); e isomorfos são os itens resultantes que compartilham radicais idênticos mas diferem apenas nos incidentais [19]. O valor prático da AIG está alinhado diretamente com a meta MVP de 2.500 itens: um especialista em testes projeta um modelo de item cuidadosamente validado com slots variáveis, e um algoritmo preenche os slots, produzindo muitos itens paralelos muito mais rápido que a autoria manual um-a-um, enquanto — se o modelo for sólido — mantém a dificuldade e a qualidade comparáveis em toda a família gerada [19]. O trade-off explícito é que a qualidade agora depende totalmente de o modelo subjacente separar corretamente radicais de incidentais; um modelo mal projetado pode gerar silenciosamente itens muito mais difíceis ou fáceis do que o pretendido, ou que compartilham um padrão superficial explorável que um resolvedor repetitivo poderia aprender. Isso defende a construção de um número menor (dezenas, não milhares) de modelos de item de alta qualidade — um por emparelhamento habilidade/misconceito identificado em pesquisas específicas de tópico já reunidas para este projeto — cada um parametrizado para emitir muitas instâncias isomórficas, ao invés de tratar “2.500 itens” como 2.500 tarefas de autoria independentes.

12. The QTI 3.0 standard

QTI (Question and Test Interoperability), mantido pela 1EdTech, é o padrão aberto dominante para empacotar itens de avaliação, testes e dados de resultados de forma que eles circulem entre ferramentas de autoria, bancos de itens e plataformas de entrega sem bloqueio de fornecedor [5]. O QTI 3.0 consolida a linha anterior QTI 2.x com a especificação de acessibilidade APIP e migra para marcação amigável à web (elementos customizados utilizáveis como componentes web padrão), enquanto mantém suporte nativo para testes adaptativos por computador e interações customizadas portáteis [5]. Concretamente, o QTI 3.0 define 21 tipos de interação padronizados, cobrindo diretamente quase todos os formatos do catálogo acima: choiceInteraction (MCQ de seleção única/múltipla), textEntryInteraction/inlineChoiceInteraction (preenchimento curto numérico/textual ou escolha embutida), extendedTextInteraction (resposta livre), gapMatchInteraction/graphicGapMatchInteraction (preencher o espaço, inclusive sobre uma imagem), matchInteraction/associateInteraction (parear dois conjuntos), orderInteraction/graphicOrderInteraction (arrastar-para-sequenciar, inclusive regiões de uma imagem), hotspotInteraction/selectPointInteraction (clicar-na-região/ponto), positionObjectInteraction (arrastar um objeto sobre uma imagem-alvo), sliderInteraction (seleção numérica limitada por arraste), drawingInteraction (marcação à mão livre em uma tela), e uploadInteraction (envio de arquivo) [6]. Adotar a nomenclatura de modelo-de-item QTI 3.0 mesmo informalmente (independentemente de o Math Challenge implementar exportação completa QTI XML no MVP) fornece um vocabulário validado e consciente de acessibilidade para o esquema de autoria de itens ao invés de inventar nomes de formato do zero, e mantém um caminho real de exportação aberto posteriormente sem necessidade de reescrita.

Catálogo de formatos de item

FormatoFaixa etáriaO que medeAuto-avaliável?Resistente ao resolvedor?Esforço de construção
Múltipla escolha (seleção única), distrações baseadas em concepções errôneasTodas as idadesReconhecimento + qual erro específico uma escolha errada revelaSim, trivialmenteBaixa — adivinhável, e vulnerável a chaves de respostas memorizadas a menos que os itens sejam variados/parametrizadosBaixo por item, maior para construir uma biblioteca real de distrações a partir de erros documentados
Seleção múltipla8+Capacidade de identificar todos os casos válidos, não apenas umSimMédia — mais difícil de adivinhar que seleção únicaBaixo
Entrada numérica com tolerância8+Cálculo, julgamento de arredondamentoSim (verificação de intervalo)MédiaBaixo
Entrada numérica, exataTodas as idadesCálculo precisoSimBaixa-médiaBaixo
Estimativa com intervalo (estilo Fermi)10+Raciocínio de ordem de grandeza, conforto com incerteza [13]Sim (contenção de intervalo)Alta — sem procedimento para memorizar, apenas uma cadeia de raciocínioMédia (necessita de uma quantidade do mundo real crível)
Preencher lacuna de equação/expressão8+Compreensão estrutural/simbólica, uma peça faltanteSimMédiaBaixa-média
Arrastar-para-ordenar6+Sequenciamento (etapas de prova, ordenação de magnitude, ordem de processo)SimMédiaMédia (necessita de interface de arrastar)
Correspondência / pareamento8+Vincular representações (gráfico↔equação, termo↔definição)SimMédiaMédia
Hotspot / selecionar-ponto / clicar-na-figura6+Identificação geométrica, leitura de diagramaSimMédiaMédia-alta (necessita de regiões de imagem)
Arrastar-sobre-imagem (posicionar objeto)8+Posicionamento espacial (plotar um ponto, colocar uma peça)SimMédiaMédia-alta
Construir-um-gráfico (plotar pontos/linha/função)11+Fluência em gráficos, comportamento de funçõesParcialmente — requer lógica de tolerânciaAltaAlta
Ordenar em categorias6+Classificação (tipo de tarefa “classificando objetos” de Swan) [9]SimMédiaBaixa-média
Encontrar-o-erro (solução trabalhada com bug inserido)10+Diagnosticar uma concepção errada específica, não apenas produzir uma resposta corretaSim se a localização do bug for discreta/etiquetadaAlta — requer compreensão do método, não correspondência de padrão de respostaMédia (necessita de biblioteca de bugs)
Qual Não Pertence (justifique sua escolha)Todas as idadesDiscurso, percepção de atributos, múltiplas razões válidasNão (avaliado pela qualidade da justificativa, ou não avaliado)Alta (nenhuma escolha “certa” única para procurar)Baixo
Padrão visual → prever passo N / escrever regra8+Generalização, raciocínio algébrico inicial [10]SimMédia-altaBaixo (altamente parametrizável)
Conversa sobre números (escolha/descreva sua estratégia mental)6+Metacognição, comparação de estratégias, senso numéricoParcialmente (múltiplas estratégias válidas)MédiaBaixo
Open Middle (encontrar o ótimo)8+Raciocínio de múltiplos caminhos rumo a uma resposta fechada [2]Sim (comparar ao ótimo conhecido)Alta — sem atalho ao redor da buscaMédia
Matemática em três atos (guiada por imagem/vídeo, sem números primeiro)8+Motivação, formulação de questões, aplicação da matemática a uma previsão real [1]Parcialmente (resposta numérica final, sim; a contextualização, não)Alta (o contexto muda a cada vez)Alta (necessita de mídia)
Formatos de quebra-cabeça (estilo KenKen/Kakuro/tangram)8+Raciocínio combinatório, satisfação de restrições, raciocínio espacial [11][12][16]SimAlta — resiste à memorização mecânica por construçãoMédia-alta (necessita de gerador/solucionador)
Manipuláveis interativos (blocos virtuais de base dez, barras de fração, tangram)3–11Ponte do concreto ao abstratoParcialmente (depende da tarefa que o envolve)MédiaAlta

Implicações de design

  1. Adotar “low floor, high ceiling, wide walls” mais a rubrica de demanda cognitiva/tarefa digna de grupo como uma lista de verificação obrigatória pré-publicação para todo modelo de item, não apenas os itens de destaque criados manualmente — até mesmo um MCQ parametrizado pode ser avaliado quanto a “isso tem mais de um caminho legítimo” [20].
  2. Marcar cada item (ou modelo de item) com qual dos cinco propósitos instrucionais de Swan ele atende (fluência, conceito, resolução de problemas não rotineiros, linguagem matemática, aplicação), já que isso deve orientar a escolha do formato, não apenas o tópico [9].
  3. Construir os 8–10 formatos de item suportados pelo MVP aproximadamente nesta ordem de custo-benefício: (1) múltipla escolha com distractores de concepções errôneas, (2) entrada numérica com tolerância, (3) seleção múltipla, (4) equação de preenchimento de lacuna, (5) classificação em categorias, (6) correspondência/pareamento, (7) arrastar-para-ordenar, (8) busca ótima no estilo Open Middle, (9) identificar-o-erro, (10) hotspot/clicar-na-figura — isso prioriza os formatos com menor custo de construção e maior auto-avaliabilidade, e adia os dois formatos mais intensivos em produção (construir-um-grafo, itens em vídeo de três atos) para um lançamento posterior.
  4. Tratar itens no estilo “three-act” e tarefas abertas verdadeiramente ricas/no estilo NRICH como um pequeno nível premium deliberadamente não escalável (dezenas de itens, não milhares) em vez de tentar impor o formato a todos os 2.500 itens — o custo de produção (mídia, pontuação aberta) é fundamentalmente incompatível com geração em massa [1][20].
  5. Investir a maior parte do esforço de autoria em modelos de item (de acordo com a estrutura de radicais/incidentes/isomorfos da Automatic Item Generation), não em itens individuais: escolher uma concepção errônea por modelo (obtida a partir da pesquisa de concepções errôneas específicas por tópico deste projeto), definir quais características numéricas/contextuais são “radicais” que devem permanecer com dificuldade constante, e permitir que um algoritmo varie os “incidentes” para alcançar volume [19].
  6. Construir uma biblioteca real, citável, de distractores por habilidade, indexada a concepções errôneas documentadas (não a números errados gerados aleatoriamente), e fazer com que o sinal diagnóstico do MVP seja qual distractor foi escolhido, não apenas certo/errado — esta é a única escolha de design de maior alavancagem para transformar um banco de exercícios em um tutor adaptativo.
  7. Usar a estrutura “closed beginning/closed end/open-middle” do Open Middle como modelo padrão para qualquer item de “encontrar o melhor/menor/maior”, pois ela é simultaneamente auto-avaliável e resistente à busca de respostas — uma combinação rara [2].
  8. Conceder ao tipo Fermi/estimação-com-faixa seu próprio tipo de item de primeira classe (entrada numérica, pontuação por banda de tolerância) em vez de forç-lo em entrada numérica exata — o contrato de pontuação é fundamentalmente diferente (contenção de intervalo, não igualdade) [13].
  9. Reservar “spot-the-error” para as concepções errôneas específicas já catalogadas na pesquisa por tópico deste projeto (por exemplo, a taxonomia de concepções errôneas de álgebra), de modo que o bug inserido na solução trabalhada seja sempre um erro real e documentado, e marcar qual bug nomeado cada item “spot-the-error” testa.
  10. Adotar os nomes de tipos de interação do QTI 3.0 (choiceInteraction, textEntryInteraction, gapMatchInteraction, matchInteraction, orderInteraction, hotspotInteraction, positionObjectInteraction, sliderInteraction, drawingInteraction, etc.) como vocabulário do esquema interno para o modelo de dados de autoria de itens agora, mesmo sem implementar importação/exportação QTI XML no MVP — isso mantém um caminho real de interoperabilidade/exportação aberto para o futuro sem reescrever o esquema [5][6].
  11. Incluir uma classe de item “sem resposta única correta, avaliada pela justificativa” (modelada em Which One Doesn’t Belong) explicitamente fora do fluxo de pontuação de pontos/maestria, já que forçar uma rotina baseada em discurso a um escore certo/errado anula seu propósito [3][4].
  12. Extrair a estrutura “problema → solução → método” dos Nove Capítulos e os problemas de círculos matemáticos russos como fonte de itens de alto teto artesanais, distintos dos exercícios curriculares, rotulados explicitamente como trilha de enriquecimento/desafio em vez de misturados anonimamente na progressão central [15][18].
  13. Se atalhos de cálculo no estilo védico forem incluídos como categoria de conteúdo “técnica de velocidade”, apresentá-los como truques aritméticos nomeados (por exemplo, “o truque de quadrado em base-10”) sem alegação de autenticidade histórica, dada a procedência contestada/politizada da moldura “matemática védica” [17].
  14. Para cada item no estilo problema de palavra (qualquer formato, não apenas MCQ), adicionar ou um distractor “essa resposta faz sentido?” (uma opção derivável numericamente, mas fisicamente absurda) ou um prompt leve de reflexão pós-resposta, já que a execução mecânica de procedimentos sem verificação de sentido no mundo real é um modo de falha recorrente e documentado, independente da habilidade matemática específica testada [1][14].

Perguntas abertas para o dono do projeto

  1. O MVP deve comprometer-se com um esquema interno modelado no QTI 3.0 desde o primeiro dia (mesmo sem exportação XML), ou essa padronização prematura é algo que a equipe prefere adiar até que haja necessidade real de interoperar com um banco de itens externo ou LMS?
  2. Para a classe de item “sem resposta única correta” (estilo Which One Doesn’t Belong), o Math Challenge deve pontuar apenas participação/engajamento, usar uma pontuação leve de justificativa avaliada por IA, ou excluir totalmente essa classe de qualquer mecânica de pontuação/seqüência?
  3. Considerando que itens no estilo Open Middle e Fermi são os dois formatos identificados como mais resistentes à busca de respostas/trapaça, a economia de XP/pontos inicial do MVP deve pesar esses formatos mais fortemente que MCQ simples para desencorajar estudantes de se direcionarem ao tipo de item “mais barato”?
  4. Quanto dos 2.500 itens alvo deve ser reservado para o pequeno nível “premium” de alta produção (três atos, tarefas ricas no estilo NRICH verdadeiro, itens de tradição de quebra-cabeças curados) versus o grande nível de templates parametrizados — existe uma proporção alvo (por exemplo, 95/5) que o proprietário deseja definir explicitamente agora, ou isso deve ser descoberto empiricamente após o primeiro sprint de conteúdo?
  5. A biblioteca de distractores baseada em concepções errôneas deve ser construída tópico a tópico à medida que a pesquisa de cada tópico é concluída (aproveitando a pesquisa de concepções errôneas por tópico já produzida para este projeto), ou centralizada como uma passagem de autoria transversal separada após a conclusão de toda a pesquisa de tópicos?

Fontes

  1. Dan Meyer, "Three-Act Math" (blog category)
  2. Robert Kaplinsky / Open Middle, "What's Open Middle?"
  3. Mary Bourassa, "Announcing the Which One Doesn't Belong? Website!"
  4. Amplify Polypad, "Which One Doesn't Belong" lesson guide
  5. 1EdTech, "QTI (Question & Test Interoperability)" standard overview
  6. 1EdTech / IMS Global, QTI 3.0 Implementation Guide (interaction types)
  7. Mathematics Assessment Project (Shell Centre / MARS), background page
  8. Mathematics Assessment Project, Classroom Challenges lessons listing
  9. Malcolm Swan, "A Designer Speaks," Educational Designer, Vol.1 Issue 1, Article 3
  10. Fawn Nguyen, Visual Patterns
  11. Wikipedia, "Kakuro"
  12. Wikipedia, "KenKen"
  13. Wikipedia, "Fermi problem"
  14. Wikipedia, "Word problem (mathematics education)"
  15. Wikipedia, "The Nine Chapters on the Mathematical Art"
  16. Wikipedia, "Tangram"
  17. Wikipedia, "Vedic mathematics"
  18. Wikipedia, "Math circle"
  19. Wikipedia, "Automatic item generation"
  20. Math Strength, "Rich Tasks"

Perguntas que este documento deixa em aberto

Ficam sem resposta de propósito. São listadas, não resolvidas — transformá-las em FAQ exigiria inventar respostas que o documento não tem.

Um de 51 documentos de pesquisa, 168.346 palavras no total, contadas na compilação a partir dos próprios arquivos. Ler este documento no repositório