Fundamentos
O perceptron
Um perceptron desenha uma fronteira linear aprendida ao aplicar um limiar a uma soma ponderada de features.
Atualizada em
1
Conceito
O perceptron é um modelo pequeno com grande pegada histórica. Ele recebe um vetor de features , guarda um peso por feature em , soma um bias e calcula . Um limiar converte a pontuação em uma de duas classes. Com labels e , a previsão é o sinal de .
Cada peso controla a contribuição de uma feature. Peso positivo eleva a pontuação quando a feature cresce; negativo reduz. A magnitude absoluta reflete sensibilidade nas unidades apresentadas. O bias funciona como intercepto: muda a pontuação-base quando todas as entradas valem zero. Escala importa, pois uma feature numericamente grande pode dominar sem ser conceitualmente mais informativa.
Em duas dimensões, descreve uma reta. Pontos de um lado produzem score positivo; do outro, negativo. O vetor é perpendicular à reta. Alterar a razão entre pesos rotaciona a fronteira; alterar a desloca sem rotação. Em mais dimensões, a mesma fronteira é um hiperplano.
A regra clássica de aprendizagem reage a erros. Para um exemplo mal classificado , uma forma atualiza e , com learning rate . Um positivo previsto como negativo puxa o vetor na direção da entrada; um negativo previsto como positivo empurra para longe. Exemplos corretos não exigem update na regra básica.
Se o dataset é linearmente separável, o teorema de convergência afirma que o procedimento chega a algum hiperplano separador depois de número finito de erros sob premissas usuais. Não promete maior margem, probabilidades calibradas ou boa generalização. O separador depende de ordem, escala, inicialização e updates. Separabilidade pertence à representação fornecida, não necessariamente ao mundo.
XOR expõe o limite. Rotule e com uma classe, e e com outra. Nenhuma reta divide os pares diagonais. Treinar por mais tempo não faz um perceptron representar fronteira não linear. Acrescentar features transformadas ou compor várias unidades com uma não linearidade muda a representação e resolve o caso. Esse passo leva às redes multicamadas.
O limiar duro também tem derivada zero quase sempre e descontinuidade na fronteira, tornando gradient descent comum inadequado. Classificadores modernos mantêm o score linear, mas usam sigmoid diferenciável durante o treino e uma loss probabilística. A decisão pode receber limiar depois. Separar score de treinamento, interpretação probabilística e threshold de política evita confusão.
Modelos de linguagem têm muito mais maquinaria, mas a lógica persiste. Um neurônio calcula soma ponderada e bias antes da activation. Heads lineares mapeiam vetores ocultos para logits. Produtos escalares pontuam compatibilidade. O perceptron ensina a geometria essencial: pesos aprendidos definem direção, bias define deslocamento e o modelo só separa padrões acessíveis na representação.
Ao inspecionar uma fronteira ajustada, plote exemplos e margens, não apenas accuracy. Um separador pode acertar toda a pequena amostra de treino e passar perigosamente perto de cada ponto, fazendo um ruído mínimo inverter decisões. Compare ainda com um baseline constante e avalie slices: uma média alta pode esconder que uma região do espaço sempre cai do lado errado.
2
Como explicar para uma criança de cinco anos
Uma segurança de museu pontua cada bolsa: número de objetos metálicos pesa a favor da inspeção, uma credencial verificada pesa contra, e um bias ajusta o rigor básico. As notas são somadas; acima do limiar, há inspeção. Mudar pesos rotaciona a fronteira da política, e mudar o bias a desloca. Nenhum ajuste de uma única fronteira reta separa visitantes dispostos num tabuleiro XOR.
3
Ensine de volta
Explique soma ponderada, bias, limiar, update de aprendizagem e limite de separabilidade linear do perceptron com duas features.
Mínimo: 80 caracteres e 15 palavras. Seu texto fica somente neste navegador.
Salvo somente neste dispositivo.
Ver uma resposta-modelo
Para features x, o perceptron calcula z=w·x+b e escolhe a classe pelo sinal de z. Em duas dimensões, z=0 é uma reta; pesos definem sua orientação e bias a desloca. Num erro, o update move pesos na direção apropriada ao exemplo rotulado. Se nenhuma reta separa as classes, como em XOR, updates não convergem para separação perfeita porque o limite é estrutural da representação, não falha do optimizer.
4
Teste seu entendimento
Conclua o teach-back e acerte o quiz para finalizar a aula.
Fontes
- Frank Rosenblatt (1958). The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain.