limit ngrams to 200 because this temporary implementation is kind of slow

This commit is contained in:
Kikimanox
2022-08-29 23:35:22 +02:00
parent 246c60de02
commit 5bdba94035
+1 -1
View File
@@ -177,7 +177,7 @@ def get_files_by_keywords(kljucnebesede):
ngrams_path = "classla_OS2022/ngrams/" if is_docker() else "../mnt/ssd/ds_ftp/classla_OS2022/ngrams/"
print("Looping trough ngrams")
for path, dirs, files, in os.walk(ngrams_path):
for i, _file in enumerate(files):
for i, _file in enumerate(files[:200]):
if i % 200 == 0: print(f"{i}/{len(files)}")
file = f'{ngrams_path}{_file}'
data = pd.read_csv(file, sep='\t')