Resultados auditáveis

Evidência antes
da escala.

Da confirmação multiseed do ASM-R ao comparativo Transformer e ao streaming ASM-C em 32K: resultados positivos e negativos orientam a próxima pergunta.

Confirmação em 100M

ASM-R replicado em três seeds

CE médio de 1,344538 ± 0,000561 (desvio-padrão populacional). As três execuções chegaram a 100M tokens com parâmetros finitos e curvas monotonicamente melhores nos marcos congelados.

SeedCEPPLTokensValidaçãoEstado
Seed 1ASM-R1,3448493,8376100M4.834.787Finito
Seed 2ASM-R1,3437513,8334100M4.834.787Finito
Seed 3ASM-R1,3450163,8382100M4.834.787Finito

Comparação exploratória · seed 1

Qualidade por token e eficiência por tempo

Na comparação original em 100M, ASM-R obteve a menor CE e ASM-S processou os tokens em menos da metade do tempo. ASM-F geração 1 não sustenta uma comparação multiseed: as seeds 2 e 3 divergiram antes de 70M.

ModeloParâmetrosCEPPLtok/sGPU h
ASM-RPromovido · qualidade por token83.206.4001,3448493,837616.5731,6762
ASM-FGeração 1 · multiseed inválido126.080.8961,3460463,842217.2061,6145
ASM-XReferência DRM explícita126.080.8961,3471033,846314.5601,9080
ASM-SCandidato · eficiência por tempo83.206.7001,3582913,889534.8760,7965

Baseline pareado · 100M · seed 1

O Transformer liderou qualidade e eficiência de treino

Com apenas 0,247% de diferença em parâmetros para o ASM-R e a mesma validação contínua de 4.834.787 tokens, o Transformer obteve CE 1,120721: 16,67% menor que o ASM-R. Também processou 69.367 tok/s, aproximadamente 4,19× o throughput.

Transformer · CE
1,120721
Transformer · PPL
3,0671
Treino
0,4005 GPU h
Throughput
69.367 tok/s
Examinar comparação e gráficos ↗

ASM-C · streaming até 32K

Estado compacto, memória associativa ainda em aberto

ASM-C reutiliza os pesos do ASM-R e muda somente o estado incremental. O cache permaneceu em 6.144 bytes, o pico em 387,53 MiB e o throughput reteve 99,6% entre 4K e 32K.

Abrir artefatos do ASM-C ↗
Throughput em 32K
503,4 tok/s
Speedup vs. ASM-R em 32K
2,97×
Redução de cache em 32K
97,71%
MQAR curto · gate 80%
32,25% · falhou

Scaling · seed 1

Qualidade por tokens e por tempo

Entropia cruzada por tokens treinadosAs quatro variantes reduzem a entropia cruzada entre 1 e 100 milhões de tokens. ASM-R termina com o menor valor e ASM-S aprende mais rapidamente no início.1M5M10M30M100M
CE sobre a mesma sequência de validação congelada. Menor é melhor.
Qualidade final por horas de GPUASM-S alcança CE 1,358 em 0,80 hora. ASM-R alcança CE 1,345 em 1,68 hora; ASM-F e ASM-X ficam próximas em qualidade com tempos maiores.0,5 h1,25 h2 hASM-SASM-FASM-RASM-X
Trade-off no marco de 100M tokens. Mais à esquerda significa menos tempo; mais acima, menor CE.
ASM-RASM-FASM-XASM-S

Protocolo

O que foi mantido constante

Todos os marcos foram rescored sobre a mesma sequência contínua de validação. Valores amostrados durante treino não foram usados para ordenar arquiteturas.

Dados
Wikipedia em memmap, tokenizer byte-level
Contexto
Sequências de 512 tokens
Validação
4.834.787 tokens congelados por marco
Precisão
BF16
Hardware
Uma NVIDIA RTX 4090
Seeds ASM-R
1, 2 e 3 até 100M tokens

Limitações

O que estes números não demonstram

  • A confirmação multiseed em 100M cobre o ASM-R; a comparação completa entre quatro variantes em 100M usa a seed 1.
  • ASM-F geração 1 divergiu nas seeds 2 e 3 e não possui resultado multiseed válido em 100M.
  • O estudo usa um dataset principal e tokenizer byte-level.
  • Throughput é específico do hardware, software e configuração medidos.
  • CE e perplexidade não medem sozinhas utilidade, segurança ou qualidade conversacional.
  • O Transformer pareado de seed única superou todas as variantes ASM em CE e eficiência de treino; o resultado ainda precisa de confirmação multiseed.
  • O streaming do ASM-C foi validado até 32K, mas sua retenção associativa longa não foi demonstrada porque o controle MQAR curto falhou.
  • Resultados de contexto acima de 512 são probes de extrapolação; o treinamento de linguagem usou sequências de 512 tokens.

Proveniência

Artefatos, hashes e configuração

Resultado concluído em 1 de agosto de 2026. O artefato público preserva os scores congelados por seed, hashes dos resumos locais e o SHA-256 do manifesto de validação 4adabd5a6a64.

Examinar artefatos no GitHub ↗