Pārlūkot izejas kodu

olny need url from list + log cleanup

David 10 gadi atpakaļ
vecāks
revīzija
fe11f1ca01
1 mainītis faili ar 8 papildinājumiem un 25 dzēšanām
  1. 8 25
      parser.py

+ 8 - 25
parser.py

@@ -37,17 +37,11 @@ class Source():
 
 class LinkList():
     def __init__(self,url,selector=None,rss=False):
+        self.links=[]
         if rss:
             feed = feedparser.parse(url)
-            print(feed["bozo"])
-            #print(feed["channel"])
-            for i in feed["items"]:
-                print(i["date"])
-                print(i["date_parsed"])
-                print(i["title"])
-                print(i["summary"])
-                print(i["link"])
-            self.links=[]
+            #print(feed["bozo"]) FIXME: If bozo==1 => error
+            self.links=[i["link"] for i in feed["items"]]
             return
         if selector is None:
             #s=newspaper.build(url,language="en",memoize_articles=False) #memoize puede salvarme la vida
@@ -59,26 +53,11 @@ class LinkList():
             s.parse_categories()
             s.generate_articles()
 
-            for a in s.articles:
-                self.articlePrinter(a)
-            print(s.size())
+            self.links=[a.url for a in s.articles]
         else:
             f=FrontPage(url,selector)
-            for l in f.links:
-                print(l)
             self.links=f.links
 
-    def articlePrinter(self,a):
-        print(a.url)
-#    def getList(self):
-#        ret=[]
-#        for art in self.source.articles:
-#            print(art)
-#            print(art.url)
-#            ret.append(art.url)
-#        return ret
-
-
 class News():
     r=re.compile(r"hours? ago|yesterday|today|last week|month",flags=re.IGNORECASE)
     def __init__(self,url,lang="en"):
@@ -126,6 +105,10 @@ l=LinkList("http://officialandroid.blogspot.com/atom.xml",rss=True)
 #n=News("http://www.alibabagroup.com/en/news/article?news=p150908b")
 #n=News("http://phx.corporate-ir.net/phoenix.zhtml?c=176060&p=irol-newsArticle&ID=1250170")
 #n=News("http://about.americanexpress.com/news/pr/2016/amex-dividend-payable-august-10-2016.aspx")
+
+for a in l.links:
+    print(a)
+print(len(l.links))
 sys.exit(1)
 def sanitizeSelector(s):
     s=s.replace(">a","> a")