README 8.4 KB

1234567891011121314151617181920212223242526272829303132333435363738394041424344454647484950515253545556575859606162636465666768697071727374757677787980818283848586878889909192939495969798
  1. Pretrained Punkt Models -- Jan Strunk (New version trained after issues 313 and 514 had been corrected)
  2. Most models were prepared using the test corpora from Kiss and Strunk (2006). Additional models have
  3. been contributed by various people using NLTK for sentence boundary detection.
  4. For information about how to use these models, please confer the tokenization HOWTO:
  5. http://nltk.googlecode.com/svn/trunk/doc/howto/tokenize.html
  6. and chapter 3.8 of the NLTK book:
  7. http://nltk.googlecode.com/svn/trunk/doc/book/ch03.html#sec-segmentation
  8. There are pretrained tokenizers for the following languages:
  9. File Language Source Contents Size of training corpus(in tokens) Model contributed by
  10. =======================================================================================================================================================================
  11. czech.pickle Czech Multilingual Corpus 1 (ECI) Lidove Noviny ~345,000 Jan Strunk / Tibor Kiss
  12. Literarni Noviny
  13. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  14. danish.pickle Danish Avisdata CD-Rom Ver. 1.1. 1995 Berlingske Tidende ~550,000 Jan Strunk / Tibor Kiss
  15. (Berlingske Avisdata, Copenhagen) Weekend Avisen
  16. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  17. dutch.pickle Dutch Multilingual Corpus 1 (ECI) De Limburger ~340,000 Jan Strunk / Tibor Kiss
  18. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  19. english.pickle English Penn Treebank (LDC) Wall Street Journal ~469,000 Jan Strunk / Tibor Kiss
  20. (American)
  21. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  22. estonian.pickle Estonian University of Tartu, Estonia Eesti Ekspress ~359,000 Jan Strunk / Tibor Kiss
  23. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  24. finnish.pickle Finnish Finnish Parole Corpus, Finnish Books and major national ~364,000 Jan Strunk / Tibor Kiss
  25. Text Bank (Suomen Kielen newspapers
  26. Tekstipankki)
  27. Finnish Center for IT Science
  28. (CSC)
  29. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  30. french.pickle French Multilingual Corpus 1 (ECI) Le Monde ~370,000 Jan Strunk / Tibor Kiss
  31. (European)
  32. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  33. german.pickle German Neue Zürcher Zeitung AG Neue Zürcher Zeitung ~847,000 Jan Strunk / Tibor Kiss
  34. (Switzerland) CD-ROM
  35. (Uses "ss"
  36. instead of "ß")
  37. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  38. greek.pickle Greek Efstathios Stamatatos To Vima (TO BHMA) ~227,000 Jan Strunk / Tibor Kiss
  39. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  40. italian.pickle Italian Multilingual Corpus 1 (ECI) La Stampa, Il Mattino ~312,000 Jan Strunk / Tibor Kiss
  41. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  42. norwegian.pickle Norwegian Centre for Humanities Bergens Tidende ~479,000 Jan Strunk / Tibor Kiss
  43. (Bokmål and Information Technologies,
  44. Nynorsk) Bergen
  45. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  46. polish.pickle Polish Polish National Corpus Literature, newspapers, etc. ~1,000,000 Krzysztof Langner
  47. (http://www.nkjp.pl/)
  48. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  49. portuguese.pickle Portuguese CETENFolha Corpus Folha de São Paulo ~321,000 Jan Strunk / Tibor Kiss
  50. (Brazilian) (Linguateca)
  51. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  52. slovene.pickle Slovene TRACTOR Delo ~354,000 Jan Strunk / Tibor Kiss
  53. Slovene Academy for Arts
  54. and Sciences
  55. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  56. spanish.pickle Spanish Multilingual Corpus 1 (ECI) Sur ~353,000 Jan Strunk / Tibor Kiss
  57. (European)
  58. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  59. swedish.pickle Swedish Multilingual Corpus 1 (ECI) Dagens Nyheter ~339,000 Jan Strunk / Tibor Kiss
  60. (and some other texts)
  61. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  62. turkish.pickle Turkish METU Turkish Corpus Milliyet ~333,000 Jan Strunk / Tibor Kiss
  63. (Türkçe Derlem Projesi)
  64. University of Ankara
  65. -----------------------------------------------------------------------------------------------------------------------------------------------------------------------
  66. The corpora contained about 400,000 tokens on average and mostly consisted of newspaper text converted to
  67. Unicode using the codecs module.
  68. Kiss, Tibor and Strunk, Jan (2006): Unsupervised Multilingual Sentence Boundary Detection.
  69. Computational Linguistics 32: 485-525.
  70. ---- Training Code ----
  71. # import punkt
  72. import nltk.tokenize.punkt
  73. # Make a new Tokenizer
  74. tokenizer = nltk.tokenize.punkt.PunktSentenceTokenizer()
  75. # Read in training corpus (one example: Slovene)
  76. import codecs
  77. text = codecs.open("slovene.plain","Ur","iso-8859-2").read()
  78. # Train tokenizer
  79. tokenizer.train(text)
  80. # Dump pickled tokenizer
  81. import pickle
  82. out = open("slovene.pickle","wb")
  83. pickle.dump(tokenizer, out)
  84. out.close()
  85. ---------