2011-10-17 6 views
30

Ho la seguente struttura dati in R:unico() per più di una variabile

> str(df) 
'data.frame': 545227 obs. of 15 variables: 
$ ykod : int 93 93 93 93 93 93 93 93 93 93 ... 
$ yad : Factor w/ 42 levels "BAKUGAN","BARBIE",..: 30 30 30 30 30 30 30 30 30 30 ... 
$ per : Factor w/ 3 levels "2 AYLIK","3 AYLIK",..: 3 3 3 3 3 3 3 3 3 3 ... 
$ donem: int 201101 201101 201101 201101 201101 201101 201101 201101 201101 201101 ... 
$ sayi : int 201101 201101 201101 201101 201101 201101 201101 201101 201101 201101 ... 
$ mkod : int 4 5 9 11 12 18 20 22 25 26 ... 
$ mad : Factor w/ 10464 levels " Defne Market   ",..: 405 8075 9710 10145 9297 7973 2542 3892 2759 5769 ... 
$ mtip : Factor w/ 29 levels "Abone Bürosu          ",..: 2 20 20 2 2 2 2 2 2 2 ... 
$ kanal: Factor w/ 2 levels "OB","SS": 2 2 2 2 2 2 2 2 2 2 ... 
$ bkod : int 110565 110565 110565 110565 110565 110565 110565 110565 110565 110565 ... 
$ bad : Factor w/ 212 levels "4. Levent","500 Evler",..: 167 167 167 167 167 167 167 167 167 167 ... 
$ bolge: Factor w/ 12 levels "Adana Şehiriçi",..: 7 7 7 7 7 7 7 7 7 7 ... 
$ sevk : int 2 3 3 3 2 2 2 6 2 2 ... 
$ iade : int 2 1 0 2 0 2 1 0 0 2 ... 
$ satis: int 0 2 3 1 2 0 1 6 2 0 ... 

voglio elencare unico (come DISTINTI di SQL) i valori per le variabili multiple selezionate. Ad esempio, unique(yad) mi dà i nomi di ogni 42 elementi, ma ho bisogno di estrarre due colonne (yad e per insieme, con tutte le combinazioni uniche):

yad   per 
---   --- 
BARBIE  AYLIK 
BAKUGAN  2 AYLIK 
MICKEY MOUSE 2 AYLIK 
TINKERBELL 3 AYLIK 
...   ... 

Come posso raggiungere questo obiettivo?

risposta

75

Come utilizzare lo stesso unique()?

df <- data.frame(yad = c("BARBIE", "BARBIE", "BAKUGAN", "BAKUGAN"), 
       per = c("AYLIK", "AYLIK", "2 AYLIK", "2 AYLIK"), 
       hmm = 1:4) 

df 
#  yad  per hmm 
# 1 BARBIE AYLIK 1 
# 2 BARBIE AYLIK 2 
# 3 BAKUGAN 2 AYLIK 3 
# 4 BAKUGAN 2 AYLIK 4 

unique(df[c("yad", "per")]) 
#  yad  per 
# 1 BARBIE AYLIK 
# 3 BAKUGAN 2 AYLIK 
+1

+ 1 Raccomanderei anche di normalizzare le stringhe (tolower, gsub out caratteri speciali, ecc.). –

+0

Come fare se 'df' è una matrice? Devo trasformarlo in 'data.frame', o c'è una funzione per farlo? – sop

+2

In realtà ho trovato 'unique.matrix()' che ha svolto il lavoro, grazie comunque – sop

5

Esistono alcuni modi per ottenere tutte le combinazioni univoche di un insieme di fattori.

with(df, interaction(yad, per, drop=TRUE)) # gives labels 
with(df, yad:per)       # ditto 

aggregate(numeric(nrow(df)), df[c("yad", "per")], length) # gives a data frame 
7

Questa è un'aggiunta alla risposta di Josh.

È possibile anche mantenere i valori di altre variabili filtrando le righe duplicate in data.table

Esempio:

library(data.table) 

#create data table 
dt <- data.table(
    V1=LETTERS[c(1,1,1,1,2,3,3,5,7,1)], 
    V2=LETTERS[c(2,3,4,2,1,4,4,6,7,2)], 
    V3=c(1), 
    V4=c(2)) 

> dt 
# V1 V2 V3 V4 
# A B 1 2 
# A C 1 2 
# A D 1 2 
# A B 1 2 
# B A 1 2 
# C D 1 2 
# C D 1 2 
# E F 1 2 
# G G 1 2 
# A B 1 2 

# set the key to all columns 
setkey(dt) 

# Get Unique lines in the data table 
unique(dt[list(V1, V2), nomatch = 0]) 

# V1 V2 V3 V4 
# A B 1 2 
# A C 1 2 
# A D 1 2 
# B A 1 2 
# C D 1 2 
# E F 1 2 
# G G 1 2 

Alert: Se vi sono diverse combinazioni di valori delle altre variabili, allora il risultato sarà combinazione

unica di V1 e V2

+0

strano, l'unica operazione funziona ma il risultato dt ha tutte le altre colonne impostate su NA. Sai perché? –

+0

Grazie per averlo scoperto. Questa operazione fa una fusione e quindi può generare alcuni valori di 'NA'. La soluzione sarebbe sostituire 'allow.cartesian = TRUE' con' nomatch = 0', cosa che ignorerebbe i valori di 'NA' nei risultati. Ho aggiornato la risposta. Grazie –

-1
df$new_var = paste(df$yad,df$per,sep = "_") 
length(unique(df$new_var)) #for checking 
df = df[!duplicated(df$new_var),] 
nrow(df) # for checking , this should be equal to 2nd line output 
df$new_var = NULL 
+0

Questo non ti dà solo i valori distinti - sovrascrive il data.frame originale. Non è quello che l'OP sta chiedendo. – BenBarnes

+0

Se non vuoi sovrascriverlo, allora è semplice amico. Basta inserire df2 invece di df nella prima riga 1st one.DONE – ashok