Remover linhas duplicadas
Remova linhas duplicadas de uma lista, com opções para ordenar, cortar espaços em branco, ignorar maiúsculas e minúsculas e remover linhas vazias. Útil para limpar listas de e-mail, arquivos de log, listas de palavras-chave e colunas CSV.
- Os arquivos nunca saem do seu dispositivo
- Grátis, sem cadastro
- Sem marcas d'água
- Funciona offline depois de carregado
Como remover linhas duplicadas
- 1
Cole sua lista
Um item por linha — e-mails, URLs, palavras-chave, qualquer coisa.
- 2
Escolha suas opções
Ordene, corte, ignore maiúsculas e minúsculas, ou mantenha apenas as linhas que aparecem mais de uma vez.
- 3
Copie o resultado
A contagem de linhas removidas é mostrada para que você saiba o que mudou.
Por que "primeira ocorrência mantida" é o padrão sensato
Quando uma lista contém várias cópias da mesma linha, tem que haver alguma regra sobre qual cópia sobrevive, e manter a primeira é a escolha que preserva mais informação sobre a lista original: a ordem sobrevivente ainda reflete como a lista foi originalmente montada, em vez de ser embaralhada pela própria etapa de deduplicação. Isso importa concretamente para uma lista que estava originalmente em uma ordem significativa — entradas adicionadas cronologicamente, ou já ordenadas por algum processo externo — onde deduplicar sem perturbar essa ordem mantém o resultado utilizável da mesma forma que o original era, apenas sem as repetições.
Ativar a ordenação depois é uma etapa separada e deliberada precisamente porque descarta essa ordem original em favor da ordem alfabética, que é a escolha certa quando a ordem original não carregava nenhum significado que valesse a pena preservar — uma exportação bagunçada de várias fontes, por exemplo — e a escolha errada quando carregava.
O que "ignorar maiúsculas e minúsculas" muda e o que não muda
"Ignorar maiúsculas e minúsculas" muda apenas como duas linhas são comparadas para decidir se são duplicatas — Apple, APPLE e apple são tratados sob essa configuração como a mesma entrada, e qual apareceu primeiro na lista é o que sobrevive, com sua própria capitalização original intacta. Esta é uma configuração apenas de comparação, não de normalização: a ferramenta nunca reescreve a capitalização de uma linha sobrevivente para corresponder a alguma forma padrão, apenas decide quais linhas contam como equivalentes para fins de encontrar repetições.
Isso importa para listas reunidas de várias fontes com capitalização inconsistente — endereços de e-mail enviados através de formulários diferentes, nomes de produto digitados por pessoas diferentes — onde sem essa configuração, "John@Example.com" e "john@example.com" seriam tratados como duas entradas distintas e ambas sobreviveriam, derrotando o propósito de deduplicar em primeiro lugar.
Encontrando duplicatas em vez de removê-las
Inverter a operação para mostrar apenas as linhas que apareceram mais de uma vez transforma isso de uma ferramenta de limpeza em uma de auditoria — útil quando o objetivo não é uma lista limpa mas uma resposta para "essa lista realmente contém duplicatas, e quais?". Este é o modo mais útil ao investigar um problema de qualidade de dados: uma lista de clientes suspeita de conter cadastros repetidos, uma lista de palavras-chave que pode ter sido montada de fontes sobrepostas, um arquivo de log onde linhas repetidas podem indicar um erro genuíno sendo registrado repetidamente em vez de uma vez.
Cortando espaços em branco antes de comparar linhas
Duas linhas que parecem visualmente idênticas ainda podem falhar em corresponder como duplicatas se uma carrega um espaço no final ou um caractere de tabulação extra invisível a olho nu — um resultado comum de copiar dados de uma planilha ou tabela, onde o preenchimento de célula às vezes é transferido como espaço em branco literal. Cortar cada linha antes de comparar remove exatamente essa classe de falso não-duplicado, capturando entradas que um revisor humano chamaria imediatamente de iguais mas que uma comparação estrita caractere por caractere não chamaria.
Perguntas frequentes
Qual duplicata é mantida?
A primeira ocorrência, então a ordem original é preservada para tudo que resta. Se você também ativar a ordenação, as linhas sobreviventes são então ordenadas alfabeticamente.
O que "ignorar maiúsculas e minúsculas" realmente faz?
Trata Apple, APPLE e apple como a mesma linha e mantém qual apareceu primeiro — com sua capitalização original intacta. Muda o que conta como duplicata, não como a saída é escrita.
Posso encontrar as duplicatas em vez de removê-las?
Sim. "Mostrar apenas duplicatas" inverte a operação e lista apenas as linhas que apareceram mais de uma vez — útil para auditar uma lista em vez de limpá-la.
Existe um limite de tamanho?
Na prática, algumas centenas de milhares de linhas. Tudo funciona no seu navegador, então o limite é a memória do seu dispositivo em vez de um teto de envio — e seus dados nunca saem da aba, o que importa para listas de clientes.
Tarefas comuns de remover linhas duplicadas
Você também pode precisar
Conversor de maiúsculas e minúsculas
Converta texto entre todos os estilos de capitalização
Contador de palavras
Conte palavras, frases e tempo de leitura enquanto você digita
CSV para JSON
Converta exportações de planilhas para JSON
Contador de caracteres
Conte caracteres contra os limites das plataformas
Comparador de Texto
Compare dois textos e destaque cada diferença
Gerador de Lorem Ipsum
Texto de preenchimento em parágrafos, frases ou palavras