2012-12-07 4 views
8

지금까지 내가 다른 문자 형식의 날짜가있는 데이터 프레임 열을 얻었습니다.동일한 열에서 여러 날짜 형식을 변경하는 방법

data$initialDiagnose = as.character(data$initialDiagnose) 
data$initialDiagnose[1:10] 

[1] "14.01.2009" "9/22/2005" "4/21/2010" "28.01.2010" "09.01.2009" "3/28/2005" "04.01.2005" "04.01.2005" "9/17/2010" "03.01.2010" 

내가 한 형식으로 날짜()로를 원하지만, R은 물론 거부 : 약간은 %m/%d/%Y 일부는 %d.%m.%Y 패턴으로 나타납니다.
는 그래서 분리기를 변경하는 처음 시도 : '.'는에

data$initialDiagnose[grep('/', data$initialDiagnose)] = as.character.Date(data$initialDiagnose[grep('/', data$initialDiagnose)], format = '%m/%d/%Y') 

아날로그 날짜. 그러나 그것은 효과가 없었습니다.

어떻게 모든 형식을 하나의 형식으로 변경할 수 있습니까?

답변

16
a <- as.Date(data$initialDiagnose,format="%m/%d/%Y") # Produces NA when format is not "%m/%d/%Y" 
b <- as.Date(data$initialDiagnose,format="%d.%m.%Y") # Produces NA when format is not "%d.%m.%Y" 
a[is.na(a)] <- b[!is.na(b)] # Combine both while keeping their ranks 
data$initialDiagnose <- a # Put it back in your dataframe 
data$initialDiagnose 
[1] "2009-01-14" "2005-09-22" "2010-04-21" "2010-01-28" "2009-01-09" "2005-03-28" "2005-01-04" "2005-01-04" "2010-09-17" "2010-01-03" 

Additionnaly 다음은 세 가지 (또는 그 이상)의 서로 다른 형식을 가지고 상황에 맞게 앞의 방법입니다 :

data$initialDiagnose 
[1] 14.01.2009 9/22/2005 12 Mar 97 4/21/2010 28.01.2010 09.01.2009 3/28/2005 
Levels: 09.01.2009 12 Mar 97 14.01.2009 28.01.2010 3/28/2005 4/21/2010 9/22/2005 

multidate <- function(data, formats){ 
    a<-list() 
    for(i in 1:length(formats)){ 
     a[[i]]<- as.Date(data,format=formats[i]) 
     a[[1]][!is.na(a[[i]])]<-a[[i]][!is.na(a[[i]])] 
     } 
    a[[1]] 
    } 

data$initialDiagnose <- multidate(data$initialDiagnose, 
            c("%m/%d/%Y","%d.%m.%Y","%d %b %y")) 
data$initialDiagnose 
[1] "2009-01-14" "2005-09-22" "1997-03-12" "2010-04-21" "2010-01-28" "2009-01-09" "2005-03-28" 
+0

감사합니다 ! 잘 작동합니다. – Rob

12

내가 사용의 용이성을 위해 lubridate 좋아 :

library(lubridate) 

# note added ugly formats below 
data <- data.frame(initialDiagnose = c("14.01.2009", "9/22/2005", 
     "4/21/2010", "28.01.2010", "09.01.2009", "3/28/2005", 
     "04.01.2005", "04.01.2005", "Created on 9/17/2010", "03 01 2010")) 

mdy <- mdy(data$initialDiagnose) 
dmy <- dmy(data$initialDiagnose) 
mdy[is.na(mdy)] <- dmy[is.na(mdy)] # some dates are ambiguous, here we give 
data$initialDiagnose <- mdy  # mdy precedence over dmy 
data 
# initialDiagnose 
#  2009-01-14 
#  2005-09-22 
#  2010-04-21 
#  2010-01-28 
#  2009-09-01 
#  2005-03-28 
#  2005-04-01 
#  2005-04-01 
#  2010-09-17 
#  2010-03-01 
+0

환경 설정을 명시 적으로 정의하는 것의 가치가 크다고 생각합니다. –

관련 문제