from sklearn.feature_extraction.text import HashingVectorizer
hvec = HashingVectorizer(stop_words='english')
hvec.fit(data_train['data'])
hvecdata = hvec.transform(data_train['data'])
X_train = pd.DataFrame(hvecdata.todense())
print(X_train.shape)
X_test = pd.DataFrame(hvec.transform(data_test['data']).todense())
print(X_test.shape)