50 ML Projects To Understand LLMs

#llm · #interpretabilidade · #machine-learning · #transformer · #neural-networks · #python

50 ML Projects To Understand LLMs

Livro de Mike X Cohen, PhD, publicado pela Packt, que propõe 50 projetos práticos para investigar os mecanismos internos de transformers através de análise de dados, visualização e experimentação. Em vez de tratar modelos como caixas-pretas, o autor combina conceitos de Machine Learning, mecanismos internos dos LLMs e programação em Python.

Pré-order no Amazon

Temas abordados no livro

  • Tokenização e suas propriedades estatísticas
  • Espaços de embeddings, similaridade semântica e vetores de analogia
  • Logits, softmax, perplexidade e vieses linguísticos
  • Dinâmica das camadas de transformers
  • Mecanismos de atenção (QKV, attention scores, head ablation e activation patching)
  • MLPs internos, análise de neurônios e manipulações causais
  • Logit Lens, causal tracing e interpretação de comportamentos emergentes

Interpretabilidade de LLMs

Mechanistic Interpretability - LessWrong

Visão geral sobre interpretabilidade mecanicista, campo que estuda como redes neurais processam informações internamente.

Análise de Transformers

The Transformer Architecture and Attention Mechanism - Lilian Weng

Artigo que detalha a arquitetura transformer e mecanismos de atenção, fundamentais para compreender como transformers funcionam internamente.

Visualização de Embeddings

Embedding Projector - TensorFlow

Ferramenta interativa para visualizar e explorar espaços de embeddings, útil para entender representações semânticas em LLMs.

Ferramentas para análise de interpretabilidade

TransformerLens - GitHub

Biblioteca Python para investigar internals de transformers, permitindo análise granular de camadas, atenção e ativações neuronais.

LIME - GitHub

Técnica e ferramenta para explicar predições de qualquer classificador ou regressor, aplicável também para análise de comportamentos de LLMs.

Recursos sobre causal tracing

Causal Tracing: Identifying Neurons That Cause Specific Behaviors - Rome Baulab

Pesquisa sobre como traçar causalidade em redes neurais, técnica essencial para entender quais neurônios são responsáveis por comportamentos específicos.

Cursos e tutoriais

Neural Network Interpretability with JAX - Google

Documentação e exemplos de como usar JAX para análise de redes neurais com foco em interpretabilidade.

Comunidade e pesquisa

Alignment Research Center - ARC

Organização de pesquisa focada em interpretabilidade e alinhamento de modelos de IA, com diversos artigos sobre mecanismos internos.