Fjernelse af dublerede linjer

5 af 2 bedømmelser
Fjernelse af dublerede linjer

Fjernelse af dublerede linjer er et gratis værktøj, der fjerner gentagne linjer fra indsat tekst og viser, hvor mange linjer der er tilbage.

Hvordan fjerner jeg dublerede linjer?

Indsæt teksten med ét element på hver linje, kør værktøjet, og kopiér derefter det rensede resultat.

  1. Sørg for, at hver mailadresse, URL, produktkode eller anden værdi står på sin egen linje.
  2. Indsend teksten for at få fjernet dubletter.
  3. Kontrollér de viste antal, og gennemgå de rensede linjer, før du bruger dem andre steder.
Værktøjet Fjernelse af dublerede linjer på digily.link med dets inputformular

Værktøjet bruger PHP-funktionen array_unique. Når den samme linje forekommer flere gange, bevares den første forekomst, mens senere identiske forekomster fjernes.

Hvornår sparer det tid at fjerne dublerede linjer?

Det sparer tid, når en liste har fået gentagne poster efter eksport, kopiering eller sammenlægning af flere kilder.

  • Eksporter fra Excel og Google Sheets indeholder ofte gentagne mailadresser, referencenumre eller varenumre, efter at regneark er blevet slået sammen.
  • Importfiler til Mailchimp kan kræve, at dublerede rækker med mailadresser fjernes før upload. Fjernelse af linjer validerer dog ikke adresser og sammenholder heller ikke separate kontaktposter.
  • Produktarbejde i Shopify kan føre til gentagne SKU'er, når værdier kopieres fra mere end én rapport.
  • Eksporter fra Google Search Console kan samles til en URL-liste med én adresse pr. linje og renses før videre analyse.
  • Konfigurationsfiler på GitHub, herunder enkle lister over tilladte og ignorerede elementer, kan indeholde identiske poster, som forskellige bidragydere har tilføjet.

Det er en god vane at gemme en urørt kopi af kilden, så du kan gendanne linjer, der er blevet fjernet som dubletter. Hvis en tilsyneladende dublet ikke fjernes, kan du undersøge den i en teksteditor, der viser afsluttende mellemrum og andre usynlige tegn.

Hvordan håndteres mellemrum, store bogstaver og tegnsætning?

Værktøjet sammenligner hele linjens værdi, så forskelle inde i en linje kan forhindre, at to poster opfattes som identiske.

Eksempelvis er "Manchester", "manchester" og "Manchester " tre forskellige strenge, fordi brugen af store og små bogstaver eller det afsluttende mellemrum varierer. Tal og tegnsætning indgår også i sammenligningen, så "INV-104" matcher ikke "INV104". Funktionen kan ikke udlede, at to forskelligt formaterede værdier henviser til den samme kunde, URL eller det samme produkt.

Tekst med accenttegn og ikke-latinske tegn kan gemmes som linjestrenge, men Unicode-tekst, der ser identisk ud, kan bestå af forskellige underliggende tegnsekvenser. Sådanne linjer kan forblive adskilte, medmindre teksten først normaliseres. Hvis tomme linjer sendes til array_unique som gentagne tomme værdier, bevares kun den første tomme værdi.

Ved meget store filer kan en regnearksfunktion eller et script være mere praktisk til at fjerne dubletter fra samtlige linjer end at indsætte filens indhold i et browserværktøj.

Eksempel på et resultat fra værktøjet Fjernelse af dublerede linjer

Hvordan læser jeg resultatet?

Resultatfelterne viser det oprindelige antal linjer, antallet af tilbageværende linjer og antallet af fjernede linjer.

  • Linjer er antallet af linjer i den indsendte liste.
  • Nye linjer er antallet, efter at dublerede værdier er fjernet.
  • Fjernede linjer viser, hvor mange gentagne værdier der blev fjernet.

Sammenhold antallet af fjernede linjer med det, du forventede. Et uventet lavt tal betyder ofte, at linjerne adskiller sig med mellemrum, store og små bogstaver eller tegnsætning. Et uventet højt tal kan være tegn på, at gentagne rækker havde en betydning i de oprindelige data, for eksempel separate transaktioner med identiske beskrivelser.

Eksempler med linjer

Med inputlinjerne "pear", "apple" og "pear" bliver resultatet "pear" og "apple". Den anden forekomst af "pear" fjernes, mens rækkefølgen af de første forekomster bevares.

Ved "London", "london" og "London " med et afsluttende mellemrum betragtes alle tre værdier som forskellige ved en direkte sammenligning af strenge. Det er en separat handling først at ensrette store og små bogstaver og fjerne mellemrum omkring værdierne.

Hvis værdierne er adskilt med kommaer i stedet for linjeskift, skal du først bruge Tekstseparator til at placere hver værdi på sin egen linje. Dubletfjernelsen arbejder med linjer, ikke med enkelte ord eller kommaseparerede felter på samme linje.

Ofte stillede spørgsmål

Kan jeg fjerne dubletter fra en CSV-fil?

Du kan indsætte CSV-indhold, men funktionen sammenligner hele rækker som linjer. Den kan ikke fjerne dubletter i én kolonne og samtidig bevare forskellige data i de tilstødende kolonner. Hvis der skal matches ud fra kolonner, kan du bruge kommandoen Fjern dubletter i Excel, Google Sheets eller et script, der er beregnet til CSV-filer.

Hvorfor bliver nummererede listepunkter ikke opfattet som dubletter?

Numre i begyndelsen er en del af hver linje, så "1. Bristol" og "2. Bristol" er forskellige værdier. Fjern nummereringen før dubletfjernelsen, hvis det er stednavnet, der skal sammenlignes.

Er det sikkert at indsætte fortrolige oplysninger?

Behandlingen foregår på serveren. Dit input sendes til serveren via HTTPS og gemmes ikke, men det forlader din enhed under behandlingen. Indsend ikke fortrolige eller regulerede data, hvis din organisations regler forbyder, at de sendes til en ekstern tjeneste.

Kan jeg bruge værktøjet til at rense JSON eller programkode?

Hvis gentagne linjer fjernes uden hensyn til strukturen, kan det beskadige JSON, kildekode og andre strukturerede formater, hvor gentaget tekst kan være tilsigtet. Brug en parser, et formateringsværktøj eller et sprogspecifikt værktøj, når strukturen og linjernes placering har betydning.

Afsluttende kontrol

Gennemgå den rensede liste, før du importerer den, især hvis dublerede linjer kan repræsentere separate ordrer, betalinger eller hændelser. Behold den oprindelige fil, indtil destinationssystemet har accepteret de reviderede data, og du har kontrolleret de linjer, som værktøjet beholdt og fjernede.

Populære værktøjer