Los
motores de búsqueda tradicionales (Google, Yahoo, etc.) sólo ofrecen acceso a
una pequeña parte de lo que existe online, lo que se ha comenzado a llamar la
web superficial o visible. Lo que resta, la Web profunda, es un amplísimo banco
de información ubicado en catálogos, revistas digitales, blogs, entradas a
diccionarios y contenido de sitios que demandan un login (aunque sea gratuito),
entre otros tipos de contenido que no aparecen entre los resultados de una
búsqueda convencional.
¿Cómo
se diferencian?
Bueno,
la Web visible comprende todos aquellos sitios cuya información puede ser
indexada por los robots de los buscadores convencionales y recuperada casi en
su totalidad mediante una consulta a sus formularios de búsqueda. Entre las
características principales de estos sitios encontramos que su información no
está contenida en bases de datos, son de libre acceso (no hay que registrarse
para acceder), en general están formadas por páginas Web estáticas (páginas o
archivos con una URL fija y accesibles desde otro enlace.).
En
contraste a la web visible, la Web invisible comprende toda la información
disponible en Internet que no es recuperada interrogando a los buscadores
convencionales. Generalmente es información almacenada y accesible mediante
bases de datos, que Si bien el 90% de estas bases de datos están públicamente
disponibles en Internet, los robots de los buscadores solamente pueden indicar
su página de entrada (homepage). La información almacenada es por consiguiente
"invisible" a estos.
NOTA:
Para poder acceder a la información disponible en las bases de datos hay que
hacer consultas a través de páginas dinámicas (ASP, PHP...) es decir páginas
que no tienen una URL fija y que se construyen en el mismo instante
(temporales) desapareciendo una vez cerrada la consulta. La información pública
y gratuita del Web invisible es actualmente de 400 a 550 veces mayor que el Web
visible.
Para
poder entender un poquito más la diferenciación entre la web superficial y la
web profunda, citaremos una caracterización de la Web invisible o profunda en la cual
identifican cuatro tipos de contenidos invisibles en la Web:
- la Web
opaca
- la Web
privada
- la Web
propietaria
- y la
Web realmente invisible
La Web
opaca: Se compone
de archivos que no están incluidos en los motores de búsqueda por alguna de
estas razones:
- Extensión
de la indización
- Frecuencia
de la indización
- Limitación
del Número máximo de resultados visibles
- URL’s
desconectadas .
La web
privada: Se compone
de archivos que no están incluidos en los motores de búsqueda por alguna de
estas razones:
- Las
páginas están protegidas por contraseñas (passwords).
- Contienen
un archivo “robots.txt” para evitar ser indizadas.
- Contienen
un campo “noindex” para evitar que el buscador indice la parte
correspondiente al cuerpo de la página.
La
Web propietaria:
Incluye aquellas páginas en las que es necesario registrarse para tener acceso al
contenido, ya sea de forma gratuita o paga. Se dice que al menos 95% de la Web
profunda contiene información de acceso público y gratuito.
La Web
realmente invisible o también oscura (Deep
web): es el término
utilizado para describir toda la información disponible en Internet que no es
recuperada interrogando a los buscadores convencionales. Generalmente es
información almacenada y accesible mediante bases de datos
Deep web funciona con la moneda más anárquica que
existe, el Bitcoin, un capital
virtual usado principalmente por el grupo hacker Anonymous para sus
transacciones dentro de Deep Web.
Deep Web está dividida en niveles de información y seguridad. A medida que
vamos indagando en su contenido se va haciendo más y más difícil avanzar.
El contenido que allí está disponible es ilegal en
muchos casos. No obstante, se hace prácticamente imposible rastrear las IP's de
los internautas que acceden a esos contenidos dado que las páginas están
encriptadas y presentan el siguiente formato
Se compone de páginas que no pueden ser
indizadas por limitaciones técnicas de los buscadores, como las siguientes:
- Páginas
web que incluyen formatos como PDF, PostScript, Flash, Shockwave,
programas ejecutables y archivos comprimidos.
- Páginas
generadas dinámicamente, es decir, que se generan a partir de datos que
introduce el usuario.
- Información
almacenada en bases de datos relacionales.
Como se accede
a la Deep Web ?
Para entrar a DeepWeb debéis
descargar el navegador Tor, ya que es el único que te proporciona una IP falsa para
poder rastrear estas páginas privadas
La
tecnología de Tor no es sólo la navegación anónima. También
se pueden alojar sitios we a través
de sus servicios ocultos que sólo son
accesibles por otros usuarios del navegador Tor.Es en uno de estos sitios de
servicio ocultos en el que se aloja algo que se conoce como la Ruta de la Seda, una red para
traficar con drogas. Según algunos informes policiales, por lo visto también se
utilizan para alojar
pornografía infantil o información relativa al tráfico de armas.
Video:
Secretos de la red tor.
Recursos de búsqueda en la Web profunda :
Buscadores
Scirus,
WebSearch.
Metabuscadores
iBoogie, Fazzle, Ixquick, Search.Com
Directorios de buscadores
AlphaSearch
Directorios
CompletePlanet, Direct Search, HotSheet, IncyWincy, InternetInvisible, Librarians Index, Master Link List On the Internet, RefDesk.com, Webfile.com, Where to Do Research
Directorios anotados
AcademicInfo, Resource Discovery Network
Directorios de bases de datos
WebData.com
Guías
About, LibrarySpot
Motores avanzados
Deep Query Manager (sustituye a Lexibot), FeedPoint, Search4science,
Strategic Finder