Web Analytics

See also ebooksgratis.com: no banners, no cookies, totally FREE.

CLASSICISTRANIERI HOME PAGE - YOUTUBE CHANNEL
Privacy Policy Cookie Policy Terms and Conditions
Wyrażenia regularne - Wikipedia, wolna encyklopedia

Wyrażenia regularne

Z Wikipedii

Wyrażenia regularne (ang. regular expressions, w skrócie regex) to wzorce, które opisują łańcuchy symboli. Teoria wyrażeń regularnych jest związana z teorią tzw. języków regularnych. Wyrażenia regularne mogą określać zbiór pasujących łańcuchów, mogą również wyszczególniać istotne części łańcucha.

Dwie najpopularniejsze składnie wyrażeń regularnych to składnia uniksowa i składnia perlowa. Składnia perlowa jest znacznie bardziej rozbudowana. Jest ona używana nie tylko w języku Perl, ale także w innych językach programowania: (Ruby), bibliotece PCRE do C i w narzędziu powłoki o nazwie pcregrep (znanego też jako pgrep).

Spis treści

[edytuj] Elementy

Podstawowe elementy wyrażeń regularnych:

  • Każdy znak, oprócz znaków specjalnych, określa sam siebie, np. "a" określa łańcuch złożony ze znaku "a".
  • Kolejne symbole oznaczają, że w łańcuchu muszą wystąpić dokładnie te symbole w dokładnie takiej samej kolejności, np. "ab" oznacza że łańcuch musi składać się z litery "a" poprzedzającej literę "b".
  • Kropka (.) oznacza dowolny znak z wyjątkiem znaku nowego wiersza (zależnie od ustawień i rodzaju wyrażeń).
  • Znaki specjalne poprzedzone odwrotnym ukośnikiem (\) powodują, że poprzedzanym znakom nie są nadawane żadne dodatkowe znaczenia - oznaczają same siebie, np "\." oznacza znak kropki (nie dowolny znak).
  • Zestaw znaków między nawiasami kwadratowymi oznacza dowolny znak objęty nawiasami kwadratowymi, np "[abc]" oznacza a, b lub c. Można używać także przedziałów: "[a-c]". Między nawiasami kwadratowymi:
    • Daszek (^) na początku zestawu oznacza wszystkie znaki oprócz tych z zestawu.
    • Aby uniknąć niejasności znaki "-" (myślnik) i "]" (zamknięcie nawiasu kwadratowego) zapisywane są na skraju zestawu lub w niektórych systemach po znaku odwrotnego ukośnika, daszek zaś wszędzie z wyjątkiem początku łańcucha. Zasady te mogą być różne w zależności od konkretnej implementacji.
    • Większość znaków specjalnych w tym miejscu traci swoje znaczenie.
  • Nawiasy okrągłe ( ( i ) ) grupują symbole.
  • Gwiazdka ( * ) po symbolu, (nawiasie, pojedynczym znaku) nazywana jest dopełnieniem Kleene'a i oznacza zero lub więcej wystąpień poprzedzającego wyrażenia.
  • Znak zapytania (?) po symbolu oznacza najwyżej jedno (być może zero) wystąpienie poprzedzającego wyrażenia.
  • Plus (+) po symbolu oznacza co najmniej jedno wystąpienie poprzedzającego go wyrażenia.
  • Daszek (^) oznacza początek wiersza, dolar ($) oznacza koniec wiersza.
  • Pionowa kreska (ang. pipeline) (|) to operator OR np. jeśli napiszemy "a|b|c" oznacza to, że w danym wyrażeniu może wystąpić "a" lub "b" lub "c".

[edytuj] Wyrażenia typu "greedy"

Kwantyfikatory w wyrażeniach regularnych dopasowują tak wiele znaków jak to możliwe – są to tzw. wyrażenia typu "greedy" (z ang. zachłanne, łapczywe). Może to być znaczącym problemem. Przykładowo, aby dopasować pierwszy element, znajdujący się w podwójnych nawiasach kwadratowych w tekście:

Kolejna eksplozja wieloryba nastąpiła na [[Tajwan]]ie, [[26 stycznia]] [[2004]].

użytkownik użyłby najchętniej wyrażenia (\[\[.*\]\]), które wygląda poprawnie (nawias kwadratowy powinien być interpretowany jako znak, dlatego poprzedzony jest odwrotnym ukośnikiem), jednak zwróci ciąg [[Tajwan]]ie, [[26 stycznia]] [[2004]] zamiast oczekiwanego [[Tajwan]].

Są dwie metody na uniknięcie tego problemu. Po pierwsze, zamiast określać co powinno być dopasowane, można określić co nie powinno być dopasowane, czyli w tym przypadku ] jest znakiem niepożądanym, więc wyrażenie miałoby postać (\[\[[^\]]*\]\]). Jednak nie uda się w ten sposób dopasować ciągu znaków w postaci:

A B C [[D E] F G]]

Drugą, bardziej współczesną metodą jest "zmuszenie" kwantyfikatora, aby nie był typu "greedy", poprzez dopisanie za nim znaku zapytania (\[\[.*?\]\]).

[edytuj] Rozszerzenia Perla

Rozszerzenia Perla to między innymi:

  • Negacja zestawu (wszystko co nie należy do zestawu).
    • cyfry są zastępowane znakami \d (dowolna cyfra) i \D (wszystko co nie jest cyfrą)
    • znaki "białe" \s i \S (przeciwieństwo)
    • rozszerzony zapis przedziałów, wprowadzenie klas znaków np.:
      • [:digit:] oznacza dowolną cyfrę
      • [:alpha:] literę
      • [:alnum:] literę lub cyfrę
    • możliwość precyzyjnego określenia liczby wystąpień danego wyrażenia
      • wyrażenie{N} oznacza dokładnie N wystąpień
      • wyrażenie{N,} co najmniej N wystąpień wyrażenia
      • wyrażenie{,M} co najwyżej M wystąpień wyrażenia
      • wyrażenie{N,M} od N do M wystąpień wyrażenia

[edytuj] Zobacz też

[edytuj] Linki zewnętrzne


aa - ab - af - ak - als - am - an - ang - ar - arc - as - ast - av - ay - az - ba - bar - bat_smg - bcl - be - be_x_old - bg - bh - bi - bm - bn - bo - bpy - br - bs - bug - bxr - ca - cbk_zam - cdo - ce - ceb - ch - cho - chr - chy - co - cr - crh - cs - csb - cu - cv - cy - da - de - diq - dsb - dv - dz - ee - el - eml - en - eo - es - et - eu - ext - fa - ff - fi - fiu_vro - fj - fo - fr - frp - fur - fy - ga - gan - gd - gl - glk - gn - got - gu - gv - ha - hak - haw - he - hi - hif - ho - hr - hsb - ht - hu - hy - hz - ia - id - ie - ig - ii - ik - ilo - io - is - it - iu - ja - jbo - jv - ka - kaa - kab - kg - ki - kj - kk - kl - km - kn - ko - kr - ks - ksh - ku - kv - kw - ky - la - lad - lb - lbe - lg - li - lij - lmo - ln - lo - lt - lv - map_bms - mdf - mg - mh - mi - mk - ml - mn - mo - mr - mt - mus - my - myv - mzn - na - nah - nap - nds - nds_nl - ne - new - ng - nl - nn - no - nov - nrm - nv - ny - oc - om - or - os - pa - pag - pam - pap - pdc - pi - pih - pl - pms - ps - pt - qu - quality - rm - rmy - rn - ro - roa_rup - roa_tara - ru - rw - sa - sah - sc - scn - sco - sd - se - sg - sh - si - simple - sk - sl - sm - sn - so - sr - srn - ss - st - stq - su - sv - sw - szl - ta - te - tet - tg - th - ti - tk - tl - tlh - tn - to - tpi - tr - ts - tt - tum - tw - ty - udm - ug - uk - ur - uz - ve - vec - vi - vls - vo - wa - war - wo - wuu - xal - xh - yi - yo - za - zea - zh - zh_classical - zh_min_nan - zh_yue - zu -