Hidden-mode markov decision processes for nonstati

Hidden-ModeMarkovDecisionProcessesforNonstationarySequentialDecisionMakingSamuelP.M.Choi,Dit-YanYeung,andNevinL.ZhangDepartmentofComputerScience,HongKongUniversityofScienceandTechnologyClearWaterBay,Kowloon,HongKongfpmchoi,dyyeung,lzhangg@cs.ust.hk1IntroductionProblemformulationisoftenanimportantrststepforsolvingaproblemeec-tively.Insequentialdecisionproblems,Markovdecisionprocess(MDP)(Bellman1957b;Puterman1994)isamodelformulationthathasbeencommonlyused,duetoitsgenerality,exibility,andapplicabilitytoawiderangeofproblems.Despitetheseadvantages,therearethreenecessaryconditionsthatmustbesatisedbeforetheMDPmodelcanbeapplied;thatis,1.Theenvironmentmodelisgiveninadvance(acompletely-knownenviron-ment).2.Theenvironmentstatesarecompletelyobservable(fully-observablestates,implyingaMarkovianenvironment).3.Theenvironmentparametersdonotchangeovertime(astationaryenviron-ment).Theseprerequisites,however,limittheusefulnessofMDPs.Inthepast,re-searcheortshavebeenmadetowardsrelaxingthersttwoconditions,leadingtodierentclassesofproblemsasillustratedinFigure1.EnvironmentObservablePartiallyObservableCompletelyStatesofObservableMDPMDPKnownPartiallyUnknownModelofEnvironmentTraditionalRLHidden-stateRLFig.1.Categorizationintofourrelatedproblemswithdierentconditions.Notethatthedegreeofdicultyincreasesfromlefttorightandfromuppertolower.Thispapermainlyaddressestherstandthirdconditions,whereasthesec-ondconditionisonlybrieydiscussed.Inparticular,weareinterestedinaspe-cialtypeofnonstationaryenvironmentsthatrepeattheirdynamicsinacertainmanner.Weproposeaformalmodelforsuchenvironments.Wealsodevelopal-gorithmsforlearningthemodelparametersandforcomputingoptimalpolicies.Beforeweproceed,letusbrieyreviewthefourcategoriesofproblemsshowninFigure1anddenetheterminologythatwillbeusedinthispaper.1.1FourProblemTypesMarkovDecisionProcessMDPisthecentralframeworkforalltheproblemswediscussinthissection.AnMDPformulatestheinteractionbetweenanagentanditsenvironment.Theenvironmentconsistsofastatespace,anactionspace,aprobabilisticstatetran-sitionfunction,andaprobabilisticrewardfunction.Thegoaloftheagentistond,accordingtoitsoptimalitycriterion,amappingfromstatestoactions(i.e.policy)thatmaximizesthelong-termaccumulatedrewards.Thispolicyiscalledanoptimalpolicy.Inthepast,severalmethodsforsolvingMarkovdecisionprob-lemshavebeendeveloped,suchasvalueiterationandpolicyiteration(Bellman1957a).ReinforcementLearningReinforcementlearning(RL)(Kaelblingetal.1996;SuttonandBarto1998)isoriginallyconcernedwithlearningtoperformasequentialdecisiontaskbasedonlyonscalarfeedbacks,withoutanyknowledgeaboutwhatthecorrectac-tionsshouldbe.AroundadecadeagoresearchersrealizedthatRLproblemscouldnaturallybeformulatedintoincompletelyknownMDPs.ThisrealizationisimportantbecauseitenablesonetoapplyexistingMDPalgorithmstoRLproblems.Thishasledtoresearchonmodel-basedRL.Themodel-basedRLap-proachrstreconstructstheenvironmentmodelbycollectingexperiencefromitsinteractionwiththeworld,andthenappliesconventionalMDPmethodstondasolution.Onthecontrary,model-freeRLlearnsanoptimalpolicydirectlyfromtheexperience.Itisthissecondapproachthataccountsforthemajordif-ferencebetweenRLandMDPalgorithms.Sincelessinformationisavailable,RLproblemsareingeneralmoredicultthantheMDPones.PartiallyObservableMarkovDecisionProcessTheassumptionofhavingfully-observablestatesissometimesimpracticalintherealworld.Inaccuratesensorydevices,forexample,couldmakethiscon-ditiondiculttoholdtrue.ThisconcernleadstostudiesonextendingMDPtopartially-observableMDP(POMDP)(Monahan1982;Lovejoy1991;WhiteIII1991).APOMDPbasicallyintroducestwoadditionalcomponentstotheoriginalMDP,i.e.anobservationspaceandanobservationprobabilityfunction.Observationsaregeneratedbasedonthecurrentstateandthepreviousaction,andaregovernedbytheobservationfunction.Theagentisonlyabletoperceiveobservations,butnotstatesthemselves.Asaresult,pastobservationsbecomerelevanttotheagent’schoiceofactions.Hence,POMDPsaresometimesreferredtoasnon-MarkovianMDPs.TraditionalapproachestoPOMDPs(Sondik1971;Cheng1998;Littmanetal.1995b;Cassandraetal.1997;Zhangetal.1997)main-tainaprobabilitydistributionoverthestates,calledbeliefstate.ItessentiallytransformstheproblemintoanMDPonewithanaugmented(andcontinuous)statespace.Unfortunately,solvingPOMDPproblemsexactlyisknowntobeintractableingeneral(PapadimitriouandTsitsiklis1987;Littmanetal.1995a).Hidden-StateReinforcementLearningRecently,researchhasbeenconductedonthecasewheretheenvironmentisbothincompletelyknownandpartiallyobservable.Thistypeofproblemsissometimesreferredtoashidden-statereinforcementlearning,incompleteper-ception,perceptionaliasing,ornon-Markovianreinforcementlearning.Hidden-stateRLalgorithmscanalsobeclassiedintomodel-basedandmodel-freeap-proaches.Fortheformer,avariantoftheBaum-Welchalgorithm(Chrisman1992)istypicallyusedformodelreconstruction,andhenceturnstheproblemintoaconventionalPOMDP.OptimalpoliciescanthenbecomputedbyusingexistingPOMDPalgorithms.Forthelatter,researcheortsarediverse,rangingfromstate-freestochasticpolicy(Jaakkol

Hidden-mode markov decision processes for nonstati

免费阅读已结束，点击付费阅读剩下 ... 页

阅读已结束，您可以下载文档离线阅读

客户关系管理(第1讲概述)

嵌入式整体家电市场信息

海口市燃气燃烧器具安装维修资质

施工组织设计一标段

RESSETDBUserGuide_金融数据库

中国现代农业建设的特征与模式(1)

广西壮族自治区人民政府关于加快建设旅游强区的决定

南京航空航天大学能源与动力学院0215

通信工程建设程序详解(南京联通)

动力配煤原理在火力发电厂中的应用

相关文档

相关搜索