Ankündigung

Einklappen
Keine Ankündigung bisher.

"Vorschautext" von einer Webseite auslesen

Einklappen

Neue Werbung 2019

Einklappen
Dieses Thema ist geschlossen.
X
X
  • Filter
  • Zeit
  • Anzeigen
Alles löschen
neue Beiträge

  • "Vorschautext" von einer Webseite auslesen

    Hy Leute,

    ich habe für einen Kunden gerade ein Webverzeichnis fertiggestellt, welches eine bestimmte Option besitzen soll. Nun hänge ich momentan an genau dieser fest...

    Das Script soll automatisch von den eingetragenen Seiten einen "Vorschautext" herauslesen, von dem man die maximale Anzahl der Zeichen im Admincenter einstellen kann. Nur ist es dort echt schwer, logische Ergebnisse zu erzielen. Ich habe das ganze mit einem Html-Parser versucht, welcher aber leider meistens quatsch liefert.

    Nun wollte ich mal fragen, ob ihr vielleicht einen Vorschlag oder Tipp für mich habt, wie man das gut umsetzen könnte... Ich würde mich über alle Antworten freuen!

    Mit freundlichen Grüßen
    Paul Dunkler

  • #2
    Kannst du das ganze etwas genauer beschreiben? "Vorschautext" und "quatsch liefern" ist so allgemein

    Kommentar


    • #3
      Ich schätze mal, dass der Parser dir Aufgrund der HTML-Struktur der Zielseiten "nur quatsch" liefert.
      Könntest du mal beispielhaft eine Website angeben und deinen Parser posten?

      Wissenswert für uns ist auch wozu der Vorschautext dienen soll um dir eventuell eine Alternative vorzuschlagen.

      Kommentar


      • #4
        Ich glaube, ich habe eine Ahnung, was er vor hat ...

        Wer OPERA kennt, findet den Startbildschirm oder zumindest den Tab-Snapshot zur Laufzeit bestimmt genauso hilfreich in der Orientierung wie ich. Mouse über Browsertab und der zeigt die aktuelle Seite im Mini-Format an ... ohne Klick auf den Tab selbst. Ob man es braucht, naja ... ^^

        Ich tippe drauf, dass der Kunde etwas ähnliches möchte - allerdings eben nur als Text. Hier fangen Deine Probleme aber an, da die Seiten, die im Webverzeichnis gelistet werden könnten, keine ähnlichen Signaturen aufweisen werden, wenn wir jetzt mal nicht über mögliche Auslesepunkte wie <body> oder ähnlich sprechen. Du musst ja Merkmale haben, wo und wie Du den Text entnehmen willst ... und während ein Eintrag alles mit CSS macht, nutzt der nächste bspw. Grafiken, das alte Font-Tag usw.

        Ich habe kürzlich Börsendaten aus einer Seite "geholt" (offizielle Anfrage ist gestellt, ob das per Cronjob erlaubt ist) und musste diesen eben sehr individuell aufbereiten - das klappt auf der Seite, ich bekomme nur die gewollte Info (muss dennoch die gesamte Seite vorher abholen) und kann diese in meine DB aufnehmen - auf der nächsten/anderen Seite klappt es nicht!! (weil anderes Seitenaufbaumuster)

        Du kannst ja auch schlecht die Seitenbetreiber dazu auffordern, "Markierungen" (z. B. <!-- ab hier Seitentext -->) einzupflegen.

        Fazit: Nur einen Teil anzeigen bzw. nur Teile daraus wirst Du global nicht hinkriegen. Demnach würde ich mich vielleicht eher am Markt orientieren: Benutze META-Tags (Title, Description) ... dann hättest Du zumindest eine Teilwahrheit.

        just my 2 cent

        S.

        Kommentar


        • #5
          Ich tippe darauf, dass es etwas ganz anderes ist und ich bitte darum den TE mal vor weiterem Tippspiel zu Wort kommen zu lassen.

          Kommentar


          • #6
            Nun vielleicht kommt er hier oder hier weiter mit seinem CROSSPOSTING... argh

            Kommentar


            • #7
              Du bist ein Fuchs!
              Nun vielleicht kommt er hier oder hier weiter
              Vielleicht wenn er mehr Infos als da oben rausgerückt hat. War wohl wieder ein eiliges und furchtbar wichtiges Problem.
              [MOD: Thread geschlossen]

              Kommentar

              Lädt...
              X