Byte pair encoding (original) (raw)

Property Value
dbo:abstract ترميز زوجين من البايت (بالإنجليزية: Byte Pair Encoding)‏ هو نموذج بسيط لضغط البيانات يقوم بستبدال زوجين من البايت على التوالي وأكثرهما شيوعاً ببايت واحد بحيث لا يتكرر البايت المستبدل في مجموعة البيانات. الزواج المستبدل يوضع في جدول لكي يتم إعادة بناء البيانات الأصلية. (ar) Byte pair encoding or digram coding is a simple form of data compression in which the most common pair of consecutive bytes of data is replaced with a byte that does not occur within that data. A table of the replacements is required to rebuild the original data. The algorithm was first described publicly by Philip Gage in a February 1994 article "A New Algorithm for Data Compression" in the C Users Journal. A variant of the technique has shown to be useful in several natural language processing (NLP) applications, such as Google's SentencePiece, and OpenAI's GPT-3. Here, the goal is not data compression, but encoding text in a given language as a sequence of 'tokens', using a fixed vocabulary of different tokens. Typically, most words will be encoded as a single token, while rare words will be encoded as a sequence of a few tokens, where these tokens represent meaningful word parts. This translation of text into tokens can be found by a variant of byte pair encoding. (en) La codificación de pares de bytes​ o la codificación de digram​ es una forma simple de compresión de datos en la que el par más común de bytes consecutivos de datos se reemplaza con un byte que no ocurre dentro de esos datos. Se requiere una tabla de reemplazos para reconstruir los datos originales. El algoritmo fue descrito públicamente por primera vez por Philip Gage en un artículo de febrero de 1994 "Un nuevo algoritmo para la compresión de datos" en el C Users Journal.​ Se ha demostrado que una variante de la técnica es útil en varias aplicaciones de procesamiento de lenguaje natural, como GPT, GPT-2 y GPT-3 de OpenAI.​ (es) バイト対符号化(ばいとついふごうか、英: Byte Pair Encoding、略してBPE)は、データ圧縮法のひとつで、可逆圧縮に分類される。一般的な圧縮法と比較して圧縮速度が極端に遅いという欠点はあるが、展開速度は爆発的な速さである。また、展開ルーチンが非常に小さく作ることが可能であるという特徴を持つ。このような特徴から、性能の低いコンピュータ用のゲームソフトのデータ圧縮などに用いられることが多い。 (ja) 字节对编码 是一种简单的数据压缩形式,这种方法用数据中不存的一个字节表示最常出现的连续字节数据。这样的替换需要重建全部原始数据。 (zh)
dbo:wikiPageID 5825526 (xsd:integer)
dbo:wikiPageLength 3989 (xsd:nonNegativeInteger)
dbo:wikiPageRevisionID 1103156211 (xsd:integer)
dbo:wikiPageWikiLink dbr:Natural_language_processing dbr:Google dbc:Lossless_compression_algorithms dbr:Byte dbr:Data_compression dbr:GPT-3 dbr:Recursion dbr:OpenAI dbr:Re-Pair dbr:Sequitur_algorithm
dbp:wikiPageUsesTemplate dbt:Compression_Methods dbt:Reflist dbt:Short_description
dct:subject dbc:Lossless_compression_algorithms
gold:hypernym dbr:Form
rdf:type yago:WikicatLosslessCompressionAlgorithms yago:Abstraction100002137 yago:Act100030358 yago:Activity100407535 yago:Algorithm105847438 yago:Event100029378 yago:Procedure101023820 yago:PsychologicalFeature100023100 yago:YagoPermanentlyLocatedEntity yago:Rule105846932
rdfs:comment ترميز زوجين من البايت (بالإنجليزية: Byte Pair Encoding)‏ هو نموذج بسيط لضغط البيانات يقوم بستبدال زوجين من البايت على التوالي وأكثرهما شيوعاً ببايت واحد بحيث لا يتكرر البايت المستبدل في مجموعة البيانات. الزواج المستبدل يوضع في جدول لكي يتم إعادة بناء البيانات الأصلية. (ar) バイト対符号化(ばいとついふごうか、英: Byte Pair Encoding、略してBPE)は、データ圧縮法のひとつで、可逆圧縮に分類される。一般的な圧縮法と比較して圧縮速度が極端に遅いという欠点はあるが、展開速度は爆発的な速さである。また、展開ルーチンが非常に小さく作ることが可能であるという特徴を持つ。このような特徴から、性能の低いコンピュータ用のゲームソフトのデータ圧縮などに用いられることが多い。 (ja) 字节对编码 是一种简单的数据压缩形式,这种方法用数据中不存的一个字节表示最常出现的连续字节数据。这样的替换需要重建全部原始数据。 (zh) Byte pair encoding or digram coding is a simple form of data compression in which the most common pair of consecutive bytes of data is replaced with a byte that does not occur within that data. A table of the replacements is required to rebuild the original data. The algorithm was first described publicly by Philip Gage in a February 1994 article "A New Algorithm for Data Compression" in the C Users Journal. (en) La codificación de pares de bytes​ o la codificación de digram​ es una forma simple de compresión de datos en la que el par más común de bytes consecutivos de datos se reemplaza con un byte que no ocurre dentro de esos datos. Se requiere una tabla de reemplazos para reconstruir los datos originales. El algoritmo fue descrito públicamente por primera vez por Philip Gage en un artículo de febrero de 1994 "Un nuevo algoritmo para la compresión de datos" en el C Users Journal.​ (es)
rdfs:label ترميز زوج البايتات (ar) Byte pair encoding (en) Codificación de pares de bytes (es) バイト対符号化 (ja) 字节对编码 (zh)
owl:sameAs freebase:Byte pair encoding wikidata:Byte pair encoding dbpedia-ar:Byte pair encoding dbpedia-es:Byte pair encoding dbpedia-ja:Byte pair encoding dbpedia-zh:Byte pair encoding https://global.dbpedia.org/id/51jJy yago-res:Byte pair encoding
prov:wasDerivedFrom wikipedia-en:Byte_pair_encoding?oldid=1103156211&ns=0
foaf:isPrimaryTopicOf wikipedia-en:Byte_pair_encoding
is dbo:wikiPageDisambiguates of dbr:BPE
is dbo:wikiPageRedirects of dbr:Byte_pair_compression dbr:Dual_tile_encoding dbr:Digram_coding
is dbo:wikiPageWikiLink of dbr:BPE dbr:List_of_algorithms dbr:Byte_pair_compression dbr:Grammar_induction dbr:GPT-3 dbr:DTE dbr:ROM_hacking dbr:Straight-line_grammar dbr:Transformer_(machine_learning_model) dbr:OpenAI dbr:Re-Pair dbr:Sequitur_algorithm dbr:Dual_tile_encoding dbr:Digram_coding
is foaf:primaryTopic of wikipedia-en:Byte_pair_encoding