MozillaPL.org - polskie centrum Mozilli

Główne menu:

[rfc][iso] UTF-8

Jak tworzyć strony WWW zgodnie ze standardami

Moderator: Pomocy?!

[rfc][iso] UTF-8

Postautor: Anonim » 29 marca 2004, 18:51

Przeglądarka: Mozilla/5.0 (Windows; U; Win98; PL; rv:1.5) Gecko/20031007 Firebird/0.7

Mógłby mi ktoś powiedzieć czym sie wyróżnia ten standard kodowania. Co go różni od starego poczciwego ISO-8859-2. Kiedy należy go używać a kiedy nie? Jakie sa jego wady a jakie zalety (interesuje mnie zwłaszcza porównanie z ISO-8859-2). W czym konwertować? Co z obsługą w starszych przeglądarkach.... dosłownie wszystko.
Wiem że mało czasu macie więc nie musicie sie rozdrabniać. Wystarczą jakieś dobre linki.

Z góry dziękuję i pozdrawiam.
Anonim
 

Re: UTF-8

Postautor: zwierz » 29 marca 2004, 19:45

Przeglądarka: Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.6) Gecko/20040207 Firefox/0.8

Anonim pisze:Mógłby mi ktoś powiedzieć czym sie wyróżnia ten standard kodowania.
Np. tym, że kiedy chce napisać trzy zdania, jedno po drugim w trzech różnych językach, to nie muszę szukać kodu w postaci
Kod: Zaznacz cały
&#1234 ; (Ӓ)
tylko wklejam sobie z tablicy znaków litery niemieckie, norweskie, hiszpańskie. Stąd nazwa: Unicode
Anonim pisze:Co go różni od starego poczciwego ISO-8859-2.

Unicode jest międzynarodowy, ISO-8859-2 jest dla Centralnej Europy
Anonim pisze:Kiedy należy go używać a kiedy nie?

Osobiście uważam, że do tworzenia nowym stron i przy generalnej przebudowie starych.
Anonim pisze:Jakie sa jego wady a jakie zalety (interesuje mnie zwłaszcza porównanie z ISO-8859-2).
Ja widzę tylko zalety: wygoda używania (patrz wyżej)
Anonim pisze: W czym konwertować?

No tu już wymięknę. Wiem tylko jak to zrobić w Linuksie (program iconv, który konwertuje chyba wszystko - łącznie z konwersją lodówki na żelazko), ale w Windows - sam chętnie usłyszę. Aha - pytanie: jakich edytorów używać pod Windows (mam w pracy), żeby nie było problemów z Unikodem (kiedyś używałem do tego VIM-a, ale ciągle mi się mieszało z tym kodowaniem). Pod Linuksem (polecam Ci) dla mnie ten problem nie istnieje, bo mam domyślne kodowanie UTF-8, poza tym edytor np. KWrite, którego używam, pozwala wybrać kodowanie takie jakie chcę
Anonim pisze:Co z obsługą w starszych przeglądarkach.... dosłownie wszystko.

Natrafiłem na problem z IE: http://mozillapl.org/forum/about-5875.html
zwierz
Moderator
 
Posty: 1915
Z nami od: 31 sierpnia 2003, 10:13
Lokalizacja: Kraków

Postautor: Olhado/256 » 29 marca 2004, 20:03

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.0; pl-PL; rv:1.6) Gecko/20040113

To ja się "podepnę" z moim pytaniem, bo chyba nie ma sensu nowego wątku zakładać. Otóż - czytałem gdzieś kiedyś, że w Mozilli wszystkie teksty (np. pozycje w menu, nazwy przycisków) są kodowane w UTF-8 właśnie. Jeśli tak jest, to jak za pomocą tego kodowania wstawić literę "ł"? Chodzi mi konkretnie o to, że za pomocą rozszerzenia Dictionarysearch dodałem sobie do menu pod PPM trzy nowe pozycje i chciałbym mieć w nich słowo "tłumacz", ale kiedy je tak po prostu wpiszę, wychodzi mi krzak zamiast "ł".
Pamiętaj obywatelu: WTYCZKI TO NIE TO SAMO, CO ROZSZERZENIA!
WinXP SP2
Olhado/256
Moderator
 
Posty: 3878
Z nami od: 26 września 2002, 09:47
Lokalizacja: Wrocław

Postautor: zwierz » 29 marca 2004, 20:10

Przeglądarka: Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.6) Gecko/20040207 Firefox/0.8

Olhado/256 pisze:chciałbym mieć w nich słowo "tłumacz", ale kiedy je tak po prostu wpiszę, wychodzi mi krzak zamiast "ł".

Strzelam: do zależy od ustawień systemu. Wpisujesz "ł", ale jest to "ł" w kodowaniu windows-1250. Ale gdzie to w Windows zmienić? Hmm.... Też bym się chętnie dowiedział.
zwierz
Moderator
 
Posty: 1915
Z nami od: 31 sierpnia 2003, 10:13
Lokalizacja: Kraków

Postautor: nikdo » 29 marca 2004, 20:56

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; pl-PL; rv:1.7b) Gecko/20040316

spróbuj podstawić & # 3 2 2; (bez spacji pomiędzy znakami)
ale nie wiem czy program nie zinterpretuje tego dosłownie :-)

nikdo

Połączenia PKP prosto z sidebaru: http://dziedzic.org/pkpanel/
nikdo
 
Posty: 421
Z nami od: 20 lutego 2003, 16:30
Lokalizacja: rybnik

Postautor: zwierz » 29 marca 2004, 21:07

Przeglądarka: Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.6) Gecko/20040207 Firefox/0.8

nikdo pisze:spróbuj podstawić & # 3 2 2; (bez spacji pomiędzy znakami)

Tyle, że właśnie po jest UTF-8, żeby nie trzeba było tego używać.
zwierz
Moderator
 
Posty: 1915
Z nami od: 31 sierpnia 2003, 10:13
Lokalizacja: Kraków

Postautor: Anonim » 29 marca 2004, 21:40

Przeglądarka: Mozilla/5.0 (Windows; U; Win98; PL; rv:1.5) Gecko/20031007 Firebird/0.7

co do konwersji to okazało się że ogonki 97 obsługują ten standard. Jestem już prawie przekonany, jedyne co mnie martwi to problemy które opisałeś @zwierz w IE5.0...
Anonim
 

Postautor: Olhado/256 » 29 marca 2004, 21:58

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.0; pl-PL; rv:1.6) Gecko/20040113

nikdo pisze:spróbuj podstawić & # 3 2 2; (bez spacji pomiędzy znakami)
ale nie wiem czy program nie zinterpretuje tego dosłownie :-)

Niestety, pojawia mi się to, co wpiszę. Natomiast zamiast "ł" pojawia mi się duże a z kółkem na górze :)
Pamiętaj obywatelu: WTYCZKI TO NIE TO SAMO, CO ROZSZERZENIA!
WinXP SP2
Olhado/256
Moderator
 
Posty: 3878
Z nami od: 26 września 2002, 09:47
Lokalizacja: Wrocław

Postautor: lenrock » 29 marca 2004, 22:28

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; PL; rv:1.6) Gecko/20040206 Firefox/0.8

O konwerterach i edytorach UTF8 uzbierało sę troche informacji na stronie http://www.4un.pl/forum/viewtopic.php?t=365
lenrock
Moderator
 
Posty: 966
Z nami od: 09 grudnia 2002, 19:33
Lokalizacja: Warszawa

Postautor: Gość » 30 marca 2004, 03:50

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.0; pl-PL; rv:1.6) Gecko/20040113 MultiZilla/1.6.3.0e

Olhado/256 pisze:Otóż - czytałem gdzieś kiedyś, że w Mozilli wszystkie teksty (np. pozycje w menu, nazwy przycisków) są kodowane w UTF-8

dobrze czytałeś ;)

Olhado/256 pisze:Jeśli tak jest, to jak za pomocą tego kodowania wstawić literę "ł"?

Kod: Zaznacz cały
Å‚
lub
Kod: Zaznacz cały
\u0142
Gość
 

Postautor: faxe » 30 marca 2004, 06:18

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; pl-PL; rv:1.6) Gecko/20040206 Firefox/0.8 (faxe)

Olhado/256 pisze:To ja się "podepnę" z moim pytaniem, bo chyba nie ma sensu nowego wątku zakładać. Otóż - czytałem gdzieś kiedyś, że w Mozilli wszystkie teksty (np. pozycje w menu, nazwy przycisków) są kodowane w UTF-8 właśnie. Jeśli tak jest, to jak za pomocą tego kodowania wstawić literę "ł"?


mi się to udało zrobić Notatnikiem (w XP) jest opcja wyboru (dość ubogiego) kodowania przy zapisie. M.in. UTF-8. A sądzę, że mi się udało, bo zapisywałem tak userChrome.css z selektorem go przycisku Przejdź w Firefoksie, coby go ukryć ;)
faxe
 
Posty: 107
Z nami od: 10 maja 2003, 16:29
Lokalizacja: Gdynia

Postautor: athantor » 30 marca 2004, 10:37

Przeglądarka: Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.7b) Gecko/20040326 Firefox/0.8.0+ (athantor)

zwierz pisze:Stąd nazwa: Unicode


W gwoli ścisłości, UTF-8 != Unicode.

UTF-(8|16(le|be)?|32(le|be)?) to rodzaj prezentacji unikodu. Unikodem nie są, tylko go "przenoszą".

zwierz pisze:
Anonim pisze:Jakie sa jego wady a jakie zalety (interesuje mnie zwłaszcza porównanie z ISO-8859-2).
Ja widzę tylko zalety: wygoda używania (patrz wyżej)


Wady:
Dla UTF-8 wzrost rozmiaru strony od dwóch do czterech bajtów na jeden ośmiobitowy znak.

Anonim pisze: W czym konwertować?

zwierz pisze:ale w Windows - sam chętnie usłyszę.


Już w innych wątkach mówiłem: Notatnik z Windows XP lub http://www.medialab.pl/cvservice/index.php

zwierz pisze:Aha - pytanie: jakich edytorów używać pod Windows (mam w pracy), żeby nie było problemów z Unikodem


gVim

zwierz pisze:(kiedyś używałem do tego VIM-a, ale ciągle mi się mieszało z tym kodowaniem).


Kod: Zaznacz cały
:set encoding=[jeden z charsetów iconv]

Sample ;-)
Obrazek Obrazek
athantor
 
Posty: 911
Z nami od: 24 grudnia 2002, 15:22
Lokalizacja: Białystok

Postautor: Olhado/256 » 30 marca 2004, 13:40

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.0; pl-PL; rv:1.6) Gecko/20040113

Anonymous pisze:
Kod: Zaznacz cały
Å‚

Zamienia na "A" z dwiema kropeczkami na górze i jedynką obok
Anonymous pisze:
Kod: Zaznacz cały
\u0142

W ogóle nie zamienia

Chyba musiałbym pogrzebać w bebechach tego dodatku, ale nie bardzo się na tym znam, zresztą nie warto chyba tak się męczyć dla jednej literki :wink:
Pamiętaj obywatelu: WTYCZKI TO NIE TO SAMO, CO ROZSZERZENIA!
WinXP SP2
Olhado/256
Moderator
 
Posty: 3878
Z nami od: 26 września 2002, 09:47
Lokalizacja: Wrocław

Postautor: Domel » 30 marca 2004, 15:44

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; PL; rv:1.6) Gecko/20040113

athantor pisze:UTF-(8|16(le|be)?|32(le|be)?) to rodzaj prezentacji unikodu. Unikodem nie są, tylko go "przenoszą".

Pozwolisz, ze uzupelnie. Z UTF-ow jest jeszcze UTF-7 (ktory podobnie jek UTF 8 posluguje sie zmienna iloscia znakow ANSII) i sa jeszcze UCS-y: UCS-4 (powiedzmy podzbior UTF-32) i UCS-2 (powiedzmy podzbior UTF-16). Sa to standardy ISO/IEC.
Moze teraz ktorka charakterystyka tych formatow. UTF-7 to taki zabieg, po to zeby powstalo kodowanie siedmio-bitowym strumieniu potrzebnych do takich rzeczy jak mail.
UTF-8 to standard przyjety przez W3C jako domyslny dla wszelkiego rodzaju aplikacji XML-a. Czyli jesli mamy sokument zgodny z XML-em i nie ma w nim nic o kodwaniu nalezy przyjac ze jest on kodowany w UTF-8? Dlaczego akurat to? Zeby odpowiedziec na do pytanie nalezy zaczac od poczatku Unicod to analogia do specyfikacji XML-a - sam w sobie jest nie mily w uzytkowaniu, trudny itp ale jest swietna baza do projektowania aplikacji takich jak XHTML, MathML, SVG i owe aplikacje juz sa latwe, przejrzyste. Ktos powie "ale czemu Ci goscie sie nie umowili zeby wprowadzic tylko jeden standard". Opowiedziec na to mozna roznie, ja podam tylko jedna opwowiedz, bo kazdy z nich nie jest taki sam i raczej nie do konca moga byc uzywane zamiennie. Np wspomniany wczesniej UTF-7 nie moze byc zamieniony np na UTF-32 bo po pierwsze nie jest to zgodne ze standardem maila i przez to nie zadzaialo by to ze soba, po drugie objetosc tak kodowanych dokunetow (np mailow) mogla by wzrosnac 4 razy. Z kolei dlaczego W3C wybrala akurat UTF-8? Wiec powiem tak, jest to stan przejsciowy. Chodzi dokladnie o to ze UTF-8 posluguje sie zmienna liczna znakow ANSII a juz UTF-16 i UTF-32 nie.
Tak wiec UTF-8 jest przejsciowy bo jest zgodny z ANSII (i z 256 znakaki z ISO-8859-1) wiec teoretycznie tekst napisany przez amerykana w UTF-8 nie bedzie zajmowal wiecej niz ten w ISO-8859-1). Z jednej strony jest to plus z drugiej minus (bo co jest zmienne jest "trudniejsze" niz to co jest stale).
A co do samego Unicodu aktualna wersja to 4.0.

athantor pisze:Notatnik z Windows XP

Notatnik nie bardzo sobie radzi z BOM-em. [jedyne edytor znany mi pod windows to Kompozytor Stron (!!!), chyba ze ktos zna inny, ktry poprawie zanisuje BOM).
Domel
 
Posty: 2252
Z nami od: 14 kwietnia 2002, 19:10
Lokalizacja: Białystok

Postautor: athantor » 30 marca 2004, 17:43

Przeglądarka: Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.7b) Gecko/20040326 Firefox/0.8.0+ (athantor)

To i ja uzupełnię :-]

Domel pisze:Moze teraz ktorka charakterystyka tych formatow. UTF-7 to taki zabieg, po to zeby powstalo kodowanie siedmio-bitowym strumieniu potrzebnych do takich rzeczy jak mail.


I jest przestarzałe i dziś niezalecane.

Domel pisze:Np wspomniany wczesniej UTF-7 nie moze byc zamieniony np na UTF-32


Jak to nie? A w czym problem?

Kod: Zaznacz cały
[athantor:~]$ cat czesc.txt
Cześć
[athantor:~]$ iconv -f=latin2 -t=utf-7 -o czesc_utf.txt < czesc.txt           
[athantor:~]$ cat czesc_utf.txt                                               
Cze+AVsBBw
[athantor:~]$ iconv -f=utf-7 -t=utf32le -o czesc_utf32.txt < czesc_utf.txt
[athantor:~]$ cat czesc_utf32.txt czesc_utf.txt.txt
Cze[
[athantor:~]$


Domel pisze:bo po pierwsze nie jest to zgodne ze standardem maila


Hmm? Standard SMTP jest '8bit clean' i nie ingeruje w treść listów. 10 lat temu może i tak, ale dziś nie.

Domel pisze:i przez to nie zadzaialo by to ze soba, po drugie objetosc tak kodowanych dokunetow (np mailow) mogla by wzrosnac 4 razy.


Niestety :-(

Domel pisze:Tak wiec UTF-8 jest przejsciowy bo jest zgodny z ANSII


A nie ASCII? :P

Domel pisze:(i z 256 znakaki z ISO-8859-1)


128. Drugie (a raczej pierwsze) 128 znaków, to te z US-ASCII. Więc, tak naprawdę to tylko 128 znaków :-)

Domel pisze:wiec teoretycznie tekst napisany przez amerykana w UTF-8 nie bedzie zajmowal wiecej niz ten w ISO-8859-1).


US-ASCII. Latin1 nie jest potrzebny dla statystycznego hamerykańca ;-)

Domel pisze:A co do samego Unicodu aktualna wersja to 4.0.


http://www.unicode.org/versions/Unicode4.0.0/

Domel pisze:
athantor pisze:Notatnik z Windows XP

Notatnik nie bardzo sobie radzi z BOM-em.


Jak to nie radzi? Dla UTF-8, BOM nie jest potrzebny ani wymagany. :o
Obrazek Obrazek
athantor
 
Posty: 911
Z nami od: 24 grudnia 2002, 15:22
Lokalizacja: Białystok

Re: UTF-8

Postautor: tomaszk » 30 marca 2004, 19:03

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.0; pl-PL; rv:1.6) Gecko/20040206 Firefox/0.8

zwierz pisze:No tu już wymięknę. Wiem tylko jak to zrobić w Linuksie (program iconv, który konwertuje chyba wszystko - łącznie z konwersją lodówki na żelazko), ale w Windows - sam chętnie usłyszę.


Proponuję iconv :D
tomaszk
 
Posty: 21
Z nami od: 16 czerwca 2003, 08:21
Lokalizacja: Poznań

Postautor: immo » 30 marca 2004, 22:42

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; en-US; rv:1.7b) Gecko/20040322 Firefox/0.8.0+

athantor pisze:
W gwoli ścisłości, UTF-8 != Unicode.

UTF-(8|16(le|be)?|32(le|be)?) to rodzaj prezentacji unikodu. Unikodem nie są, tylko go "przenoszą".


Gwoli ścisłości, UTF to Unicode Transformation Format. Unicode nie jest ani 32 bitowy, ani 16 czy 8. Unicode to poprostu numery przypisane do znaków, co oznacza, że można je tak naprawdę przedstawiać tak jak się komukolwiek podoba, byle dało się odczytać numery znaków. Można używać encji, można również transformować w najróżniejszy sposób. Fak więc UTF-8 jest niczym innym jak jednym z formatów Unicode.

Reasumując: Unicode = standard Unicode. UTF = format zapisu standardu Unicode.
immo
 

Postautor: Domel » 31 marca 2004, 20:03

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; PL; rv:1.6) Gecko/20040113

athantor pisze:I jest przestarzałe i dziś niezalecane.

Tak, wlasnie tak napisalem, nie wiem po co powtarzasz :P

athantor pisze:Jak to nie? A w czym problem?
Hmm? Standard SMTP jest '8bit clean' i nie ingeruje w treść listów. 10 lat temu może i tak, ale dziś nie.

Na pytanie po czesci sam sobie odpowiedziales z kolejnym zdaniu. A ja odpwiadam RFC2045.

athantor pisze:128. Drugie (a raczej pierwsze) 128 znaków, to te z US-ASCII. Więc, tak naprawdę to tylko 128 znaków :-)

Z ISO-8859-1 256 a z ASCII 128. Nie znasz specyfikacji :D

athantor pisze:Latin1 nie jest potrzebny dla statystycznego hamerykańca ;-)

Mozliwem tu nie chodzi o to co jest potrzebne, tylko chodzi o zgodnosc w stecz. Szczegolnie ze mozna by powiedzec myslac takim tokiem, ze i UTF-8 nie jest potrzebne.

athantor pisze:http://www.unicode.org/versions/Unicode4.0.0/

Jesli juz to
http://www.unicode.org/versions/Unicode4.0.1/ :D

athantor pisze:Jak to nie radzi? Dla UTF-8, BOM nie jest potrzebny ani wymagany. :o

No to zdecyduj sie, bo pytanie sugeruje ze sobie dadzi natomiast drugie zdanie ze nie musi sobie radzic. Zreszta niewazne, poniewaz pomyliles pojecia: nie chodzi o to czy jest wymagany czy nie (szczegolnie ze zgadzam sie ze nie jest wymagany) tylko czy notatnik to obsluguje. Chodzi o to ze nie jest wymagany ale to nie znaczy ze byc nie powinien. Moze akurat ja chcem zeby bylo a notanik na to nie pozwala (np w przypadku langpackow wydawanych przez mozillapl.org, nie moge edytowac w notatniku, poniewaz pojawiaja sie bledy parsera. A jak widac wlasnie Twoja przegladarka dziala, co jest dowodem, ze nie byla tlumaczona w Notatniku :P ). Reasumujac wlalbym zeby Notatkim cos obslugiwla w 100% a nie w 50%.
Domel
 
Posty: 2252
Z nami od: 14 kwietnia 2002, 19:10
Lokalizacja: Białystok

Postautor: lenrock » 31 marca 2004, 20:24

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; PL; rv:1.6) Gecko/20040206 Firefox/0.8

Domel pisze: (np w przypadku langpackow wydawanych przez mozillapl.org, nie moge edytowac w notatniku, poniewaz pojawiaja sie bledy parsera.

Ja tłumaczenia dodatków robię w Infoxie . Ale jak próbowałem dojść czemu Notatnik robi to żle to stwierdziłem że Notatnik dopisuje niepotzebne dane na poczatku pliku tekstowego(pare znaków) i jak sie je usunie to już wszystko gra , tyle że trzeba mieć narzędzie inne niż notatnik do usuwania tych 3-4 znaków :)
lenrock
Moderator
 
Posty: 966
Z nami od: 09 grudnia 2002, 19:33
Lokalizacja: Warszawa

Postautor: Domel » 31 marca 2004, 20:28

Przeglądarka: Mozilla/5.0 (Windows; U; Windows NT 5.1; PL; rv:1.6) Gecko/20040113

lenrock pisze:Ja tłumaczenia dodatków robię w Infoxie .

Dokladnie tez w nim pisze. Chyba od wersji 0.8 go uzywam.

lenrock pisze:Ale jak próbowałem dojść czemu Notatnik robi to żle to stwierdziłem że Notatnik dopisuje niepotzebne dane na poczatku pliku tekstowego

Dokladnie, to tym pisalem.
Domel
 
Posty: 2252
Z nami od: 14 kwietnia 2002, 19:10
Lokalizacja: Białystok

Następna

Wróć do Tworzenie stron WWW

Kto jest online

Zarejestrowani użytkownicy: Baidu [Spider], dexter, Google [Bot]

Przejdź do powiązanej strony

Nawigacja:

Stopka: