# 50 ML Projects To Understand LLMs

- Publicado: 2026-08-09
- Resumo: Curadoria de recursos sobre interpretabilidade e análise interna de modelos de linguagem através de projetos práticos
- Tags: llm, interpretabilidade, machine-learning, transformer, neural-networks, python
- Página HTML: https://ronanrodrigo.dev/notes/2026/08/09/50ml-projects-llms/

---
## 50 ML Projects To Understand LLMs

Livro de Mike X Cohen, PhD, publicado pela Packt, que propõe 50 projetos práticos para investigar os mecanismos internos de transformers através de análise de dados, visualização e experimentação. Em vez de tratar modelos como caixas-pretas, o autor combina conceitos de Machine Learning, mecanismos internos dos LLMs e programação em Python.

[Pré-order no Amazon](https://amzn.to/4etZJll)

## Temas abordados no livro

- Tokenização e suas propriedades estatísticas
- Espaços de embeddings, similaridade semântica e vetores de analogia
- Logits, softmax, perplexidade e vieses linguísticos
- Dinâmica das camadas de transformers
- Mecanismos de atenção (QKV, attention scores, head ablation e activation patching)
- MLPs internos, análise de neurônios e manipulações causais
- Logit Lens, causal tracing e interpretação de comportamentos emergentes

## Interpretabilidade de LLMs

[Mechanistic Interpretability](https://www.lesswrong.com/tag/mechanistic-interpretability) - LessWrong

Visão geral sobre interpretabilidade mecanicista, campo que estuda como redes neurais processam informações internamente.

## Análise de Transformers

[The Transformer Architecture and Attention Mechanism](https://lilianwang.substack.com/p/the-transformer-architecture-and-attention) - Lilian Weng

Artigo que detalha a arquitetura transformer e mecanismos de atenção, fundamentais para compreender como transformers funcionam internamente.

## Visualização de Embeddings

[Embedding Projector](https://projector.tensorflow.org/) - TensorFlow

Ferramenta interativa para visualizar e explorar espaços de embeddings, útil para entender representações semânticas em LLMs.

## Ferramentas para análise de interpretabilidade

[TransformerLens](https://github.com/neelgupta/TransformerLens) - GitHub

Biblioteca Python para investigar internals de transformers, permitindo análise granular de camadas, atenção e ativações neuronais.

[LIME](https://github.com/marcotcr/lime) - GitHub

Técnica e ferramenta para explicar predições de qualquer classificador ou regressor, aplicável também para análise de comportamentos de LLMs.

## Recursos sobre causal tracing

[Causal Tracing: Identifying Neurons That Cause Specific Behaviors](https://rome.baulab.info/) - Rome Baulab

Pesquisa sobre como traçar causalidade em redes neurais, técnica essencial para entender quais neurônios são responsáveis por comportamentos específicos.

## Cursos e tutoriais

[Neural Network Interpretability with JAX](https://github.com/google/jax) - Google

Documentação e exemplos de como usar JAX para análise de redes neurais com foco em interpretabilidade.

## Comunidade e pesquisa

[Alignment Research Center](https://alignment.org/) - ARC

Organização de pesquisa focada em interpretabilidade e alinhamento de modelos de IA, com diversos artigos sobre mecanismos internos.
