Brug for ekspert hjælp med fejl i min regex.
Hey..Jeg har lavet en regex til noget scanning af interne sider til mit firma.. det virker for vildt, dog har jeg fundet en meget underlig fejl, som jeg håber i kan hjælpe mig med.
min regex:
-----
<a[\w\d"" =^href]*href[^=]*[^\w/.]*(?<url>[\w/:.-]*\d+[\w/-]*[^.]*.(?<ext>[\w+]+)*)[^>]*>[\w\d ""^<img]*img[\w\d"" =^src]*src[^=]*[^\w./]*(?<urla>[\w/:.-]*\d+[\w/-]*[^.]*.(?<exta>[\w+]+)*)[^>]*>
-----
den crawler nogle sider med links så som denne:
-----
<a href="image/pic01.jpg"><img src="http://intranet.dk/pic01.gif">d</a>
-----
det overstående virker fint sammen, men så begyndte min pc at gå helt amok da den stødte på denne url:
-----
<a href="http://www.localhost.com/214270/1/mangelinksdddd/today/015/">links</a>
-----
det virker som om at jo flere bokstaver som der er der hvor der står 'mangelinksdddd' desto længe tid tager det for den at køre igennem.., og det er i sær noget møg når der f.eks. er 10 af denne slags links på en link side :( piv.
På forhånd tak.
Testkanin
