Resultados auditáveis
Evidência antes
da escala.
Da confirmação multiseed do ASM-R ao comparativo Transformer e ao streaming ASM-C em 32K: resultados positivos e negativos orientam a próxima pergunta.
Confirmação em 100M
ASM-R replicado em três seeds
CE médio de 1,344538 ± 0,000561 (desvio-padrão populacional). As três execuções chegaram a 100M tokens com parâmetros finitos e curvas monotonicamente melhores nos marcos congelados.
Comparação exploratória · seed 1
Qualidade por token e eficiência por tempo
Na comparação original em 100M, ASM-R obteve a menor CE e ASM-S processou os tokens em menos da metade do tempo. ASM-F geração 1 não sustenta uma comparação multiseed: as seeds 2 e 3 divergiram antes de 70M.
Baseline pareado · 100M · seed 1
O Transformer liderou qualidade e eficiência de treino
Com apenas 0,247% de diferença em parâmetros para o ASM-R e a mesma validação contínua de 4.834.787 tokens, o Transformer obteve CE 1,120721: 16,67% menor que o ASM-R. Também processou 69.367 tok/s, aproximadamente 4,19× o throughput.
- Transformer · CE
- 1,120721
- Transformer · PPL
- 3,0671
- Treino
- 0,4005 GPU h
- Throughput
- 69.367 tok/s
ASM-C · streaming até 32K
Estado compacto, memória associativa ainda em aberto
ASM-C reutiliza os pesos do ASM-R e muda somente o estado incremental. O cache permaneceu em 6.144 bytes, o pico em 387,53 MiB e o throughput reteve 99,6% entre 4K e 32K.
Abrir artefatos do ASM-C ↗- Throughput em 32K
- 503,4 tok/s
- Speedup vs. ASM-R em 32K
- 2,97×
- Redução de cache em 32K
- 97,71%
- MQAR curto · gate 80%
- 32,25% · falhou
Scaling · seed 1
Qualidade por tokens e por tempo
Protocolo
O que foi mantido constante
Todos os marcos foram rescored sobre a mesma sequência contínua de validação. Valores amostrados durante treino não foram usados para ordenar arquiteturas.
- Dados
- Wikipedia em memmap, tokenizer byte-level
- Contexto
- Sequências de 512 tokens
- Validação
- 4.834.787 tokens congelados por marco
- Precisão
- BF16
- Hardware
- Uma NVIDIA RTX 4090
- Seeds ASM-R
- 1, 2 e 3 até 100M tokens
Limitações
O que estes números não demonstram
- A confirmação multiseed em 100M cobre o ASM-R; a comparação completa entre quatro variantes em 100M usa a seed 1.
- ASM-F geração 1 divergiu nas seeds 2 e 3 e não possui resultado multiseed válido em 100M.
- O estudo usa um dataset principal e tokenizer byte-level.
- Throughput é específico do hardware, software e configuração medidos.
- CE e perplexidade não medem sozinhas utilidade, segurança ou qualidade conversacional.
- O Transformer pareado de seed única superou todas as variantes ASM em CE e eficiência de treino; o resultado ainda precisa de confirmação multiseed.
- O streaming do ASM-C foi validado até 32K, mas sua retenção associativa longa não foi demonstrada porque o controle MQAR curto falhou.
- Resultados de contexto acima de 512 são probes de extrapolação; o treinamento de linguagem usou sequências de 512 tokens.
Proveniência
Artefatos, hashes e configuração
Resultado concluído em 1 de agosto de 2026. O artefato público preserva os scores congelados por seed, hashes dos resumos locais e o SHA-256 do manifesto de validação 4adabd5a6a64….