extract-txt-bin-portions.pl: programa el Perl para encontrar cadenas UTF-8 en archivos binarios sin formato
# Lee un archivo mixto UTF-8 - no UTF-8 # output: # Repeticiones de las líneas de texto: # "bin: " byte-inicial-secuencia-no-UTF-8 byte-final-secuencia-no-UTF-8 # "txt: " byte-inicial-secuencia-UTF-8 byte-final-secuencia-UTF-8 # por orden de aparición de las secuencias (orden normal de los bytes dentro del archivo) open my $fh, "<:raw", @ARGV[0] or die "cannot open < @ARGV[0]: $!"; my $i = 0; my $ini_ciclo_bin = 1; my $length = read $fh, my $byte, 1; $i += $length; # print "a ".unpack("B*", $byte) . "\n"; my $ini_bin; my $fin_bin; my $ini_txt; my $fin_txt; while($length) { # ciclo bin while($length and not unpack("B*", $byte) =~ /^(0|110|1110|11110|111110|1111110).*/) { $length = read $fh, $byte, 1; $i += $length; # print "b ".unpack("B*", $byte) . "\n"; } # ciclo txt # inicialización secuencia txt $ini_txt = $i; $fin_txt = 0; ...