HTML Microdata document

This HTML5 document contains 11 embedded RDF statements represented using HTML+Microdata notation.

The embedded RDF content will be recognized by any processor of HTML5 Microdata.

Prefix	Namespace IRI
category-es	http://es.dbpedia.org/resource/CategorÃa:
dct	http://purl.org/dc/terms/
wikipedia-es	http://es.wikipedia.org/wiki/
dbo	http://dbpedia.org/ontology/
foaf	http://xmlns.com/foaf/0.1/
dbpedia-es	http://es.dbpedia.org/resource/
rdfs	http://www.w3.org/2000/01/rdf-schema#
rdf	http://www.w3.org/1999/02/22-rdf-syntax-ns#
owl	http://www.w3.org/2002/07/owl#
n12	http://es.wikipedia.org/wiki/Bandido_multibrazo?oldid=118718140&ns=
prov	http://www.w3.org/ns/prov#
xsdh	http://www.w3.org/2001/XMLSchema#
dbr	http://dbpedia.org/resource/

Subject Item: dbpedia-es:Bandido_multibrazo
rdfs:label: Bandido multibrazo
rdfs:comment: En teoría de la probabilidad, el problema del bandido multibrazo (también llamado (problema del bandido de N o K brazos) es un problema en el que un jugador ante una fila de tragaperras (también denominadas "bandidos de un solo brazo") tiene que decidir con qué máquinas juega, y en qué orden. Cuando juega, cada tragaperras devuelve una recompensa aleatoria derivada de la distribución de probabilidad específica de la máquina. El objetivo del jugador es maximizar la suma de las recompensas obtenidas a través de una secuencia de máquinas. * Datos: Q2882343
dct:subject: category-es:Aprendizaje_automÃ¡tico
foaf:isPrimaryTopicOf: wikipedia-es:Bandido_multibrazo
dbo:wikiPageID: 8236897
dbo:wikiPageRevisionID: 118718140
dbo:wikiPageLength: 1165
prov:wasDerivedFrom: n12:0
dbo:abstract: En teoría de la probabilidad, el problema del bandido multibrazo (también llamado (problema del bandido de N o K brazos) es un problema en el que un jugador ante una fila de tragaperras (también denominadas "bandidos de un solo brazo") tiene que decidir con qué máquinas juega, y en qué orden. Cuando juega, cada tragaperras devuelve una recompensa aleatoria derivada de la distribución de probabilidad específica de la máquina. El objetivo del jugador es maximizar la suma de las recompensas obtenidas a través de una secuencia de máquinas. En versiones iniciales de este problema, el jugador no tiene información inicial sobre las máquinas. El compromiso esencial que el jugador debe abordar en cada iteración es entonces entre la explotación de la máquina con mayor recompensa esperada y la exploración del resto para obtener más información sobre las recompensas esperadas de las demás tragaperras. Este compromiso entre exploración y explotación también aparece en el contexto de aprendizaje reforzado (reinforced learning). * Datos: Q2882343

Subject Item: wikipedia-es:Bandido_multibrazo
foaf:primaryTopic: dbpedia-es:Bandido_multibrazo

Subject Item: dbr:Multi-armed_bandit
owl:sameAs: dbpedia-es:Bandido_multibrazo