db.py 3.9 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117
  1. from pymongo import MongoClient,errors,DESCENDING,ASCENDING
  2. from bson.objectid import ObjectId
  3. import datetime
  4. import re
  5. class db():
  6. DB="alexis"
  7. def __init__(self):
  8. self.client = MongoClient('localhost', 27017)
  9. self.c_sources=self.client[self.DB]["sources"]
  10. self.c_articles=self.client[self.DB]["articles"]
  11. def jsonable(self, el):
  12. if el is None or "_id" not in el:
  13. return el
  14. el["_id"]=str(el["_id"])
  15. return el
  16. def filter_articles(self, filter, limit=80):
  17. db_filter={}
  18. db_filter["matches"]=True
  19. db_filter["scrap_date"]={}
  20. if "maxdate" in filter and len(filter["maxdate"])>7:
  21. db_filter["scrap_date"]["$lt"]=datetime.datetime.strptime(filter["maxdate"],"%Y-%m-%d")
  22. if "mindate" in filter and len(filter["mindate"])>7:
  23. db_filter["scrap_date"]["$gt"]=datetime.datetime.strptime(filter["mindate"],"%Y-%m-%d")
  24. if db_filter["scrap_date"]=={}:
  25. del db_filter["scrap_date"]
  26. if "site" in filter and filter["site"] != "":
  27. filter["site"]=filter["site"].replace("(","\(").replace(")","\)")
  28. db_filter["source_name"]={"$regex":".*%s.*"%filter["site"], "$options": 'i'}
  29. #db_filter["$or"]=[
  30. # {"source_name": {"$regex":".*%s.*"%filter["site"], "$options": 'i'}},
  31. # {"url": {"$regex":".*%s.*"%filter["site"], "$options": 'i' }}
  32. # ]
  33. if "minweight" in filter and filter["minweight"] != "":
  34. db_filter["weight"]={"$gt":int(filter["minweight"])}
  35. if "keyword" in filter and len(filter["keyword"]) >0:
  36. db_filter["kw"]={"$all": filter["keyword"]}
  37. pageNumber=0
  38. if "page" in filter:
  39. pageNumber=filter["page"]
  40. #print(db_filter)
  41. res = self.c_articles.find(db_filter,{"html":0,"text":0})
  42. if res is not None:
  43. toSkip=(((pageNumber-1)*limit) if pageNumber > 0 else 0)
  44. q = res.skip(toSkip).sort("scrap_date",DESCENDING).limit(limit)
  45. count = q.count()
  46. else:
  47. q = []
  48. count = 0
  49. return { 'articles': [ self.jsonable(p) for p in q ],
  50. 'count' : count }
  51. def article(self, id):
  52. ret=self.c_articles.find_one({"_id":ObjectId(id)})
  53. return self.jsonable(ret)
  54. def sources(self,id=None):
  55. if id is None:
  56. return [ self.jsonable(p) for p in self.c_sources.find() ]
  57. ret=self.c_sources.find_one({"_id":ObjectId(id)})
  58. return self.jsonable(ret)
  59. def rss_sources(self):
  60. return [ p for p in self.c_sources.find({"rss":1}) ]
  61. def insert_article(self,o):
  62. try:
  63. self.c_articles.insert_one(o)
  64. return True
  65. except errors.DuplicateKeyError:
  66. print("Dup")
  67. return False
  68. def purge_error(self):
  69. self.c_articles.remove({'error':True})
  70. def article_exists(self,url):
  71. ret=self.c_articles.find_one({'url':url})
  72. if ret is None:
  73. return False
  74. return True
  75. def lower_arr(self,arr):
  76. return [a.lower() for a in arr]
  77. def to_regex(self,arr): #"ACH" | "PAYMENT" | "EBAY"
  78. return [ re.compile('\b'+w.lower()+'\b') for w in arr ]
  79. def get_keywords_list(self):
  80. kw=self.client[self.DB]["keywords"]
  81. return [ k["keyword"] for k in kw.find({}) ]
  82. def get_keywords(self,category):
  83. kw=self.client[self.DB]["keywords"] #FIXME, split on "|" or regex
  84. ret = [ {"weight":k["weight"],
  85. "kw": k["keyword"],
  86. "pattern": self.to_regex(k["keyword"].split("|")) } for k in kw.find({}) ]#FIXME, categories
  87. return ret
  88. def add_source(self,url,rss,selector,name):
  89. self.c_sources.insert({"link":url,
  90. "rss":rss,
  91. "selector":selector,
  92. "name":name,
  93. "category":0})