Code and corpus files

Results

Accuracy with Unigrams: 44.5%
Accuracy with Bigrams: 38%
Accuracy after adding phonetic features: 46%

Optimizations

Details of Corpus files used:


Number of tokens : 16208819
Size of vocabulary : 291633
Number of distinct unigrams : 67240
Number of distinct bigrams : 1087879