Spring til indhold
S

sCrawler

Forlægger: SqrBox
Virus-scannet Windows Free
Hent v1.0 292 downloads
Version1.0
Forlægger SqrBox
Udgivelses dato18. mar. 2013
Dato tilføjet18. mar. 2013
Os kravWindows
Krav.NET Framework 3.5
Samlet antal downloads292
PrisFree

Beskrivelse

Der er et utal af grunde til, at en person eller virksomhed ønsker at bruge webcrawler-software. Denne type program surfer på nettet på en bestemt måde, som kan være automatiseret, metodisk eller på en velordnet måde. Hvis du er ny til begrebet webcrawler-software, har du måske hørt om edderkopper, bots, myrer, automatiske indekser, robotter eller scuttere? De er alle grundlæggende det samme!

Formålet med webcrawler-software

Når du tænker på webcrawling-software, forestiller du dig sandsynligvis de store navnesøgemaskiner som Google, Bing og Yahoo. Deres bots gennemgår websider for at bestemme indhold, relevans og indeksering. Ved at oprette en kopi af besøgte sider kan de give hurtigere og mere præcise søgninger. SqrBox vil fortælle dig, at du bestemt ikke behøver at være en søgemaskine for at have et behov for webcrawler-software. Du skal simpelthen være en person, der har behov for at samle store mængder eller ekstremt indviklede informationer.

Typer af webcrawler-software

Hvis du planlægger at bruge tjenester fra en professionel virksomhed som SqrBox, behøver du ikke rigtig at bekymre dig om alt det komplicerede sprog om webcrawler-software. Alligevel er det nyttigt at forstå et par ting om det.

Fokuseret crawling - Formålet med denne type webcrawler-software er at downloade sider, der ser ud til at indeholde lignende oplysninger. Der er dog ofte nogle mangler forbundet med denne metode, og den faktiske ydelse af crawleren og resultatet afhænger af, hvor rige linksene er om det specifikke emne, der søges efter. Denne type webcrawler-software bruges ofte som udgangspunkt for at indsnævre søgninger for yderligere crawl.

URL-normalisering – webcrawler-software udfører ofte et vist niveau af URL-normalisering, som hjælper med at reducere gentagen gennemgang af den samme kilde mere end én gang.

Begrænsning af fulgte links - I nogle tilfælde vil webcrawler-software måske undgå bestemt webindhold og kun opsøge .html-sider. For at gøre dette undersøges URL'en ofte, og derefter vil der kun blive anmodet om ressourcer, hvis der er bestemte tegn i URL'en såsom .html, .asp, .htm, .php, .aspx, .jspx eller .jsp. webcrawler-software vil typisk ignorere ressourcer med et "?" for at undgå edderkoppefælder.

Lignende programmer

Alternativer