Bluffar ur ett spelteoretiskt perspektiv
Inledning
I denna artikel
- Matematiken bakom
- Optimala strategier
- Nash-jämvikt
Bluffar är en av viktig beståndsdel i poker och alla bra pokerspelare har dem i sin arsenal. Spelare som aldrig bluffar gör gigantiska misstag, det gör även de som bluffar för mycket. Hur hittar vi då den rätta balansen? Hur kan du avgöra när det är en god idé att bluffa, hur vet du när och hur ofta du bör bluffa mot specifika motståndare för att spela profitabelt mot dem.
Denna artikel behandlar den matematiken bakom bluffar och ger en spelteoretisk approach för att illustrera möjliga strategier.
BÖR JAG BLUFFA?
Du befinner dig på rivern. Brädan visar .
Du är ganska säker på att din motståndare har en färdig hand. Från att ha följt hans spel antar du att han troligtvis har AA, KK eller AK. Du har .
Ett missat drag. Potten är på $100, och ni har båda har kvar $100. Du är först ut. Om du checkar, kommer du att förlora (antingen genom att din motståndare checkar bakom och vinner vid showdown, eller att han satsar, och du har inte tillräckligt med pengar för att försöka bluffa bort honom.)
Låt oss anta att din motståndare har läst dig rätt, och satt dig på ett drag före rivern. För enkelhetens skull, anta att han även tror att sannolikheten för ett missad färg (eller gutshot) drag är 80%, och att han tror att du sitter 87 20% av gångerna och då fick en stege med hjälp av riverkortet.
Om du hade en stege med 87, skulle du satsa för värde. Men tyvärr så missade du denna gången. Du har nu två val: ge upp och checka, eller försöka att köpa potten med en bluff. Låt oss anta att när du bluffar, går du all-in för dina $100, vilket är ett pottsize-bet. Hur ofta bör du bluffa?
Hur kan vi svara på denna frågan?
För detta behöver vi matte. Men oroa dig inge, det kommer inte att vara allt för komplicerat. Bara lite algebra på grundskolenivå samt lite sunt förnuft. Oops, jag glömde nästan - och spelteori, men det kommer att gå under 'sunt förnuft'-delen.
ÖVERSÄTTA FRÅGAN TILL MATEMATIK
Vi behöver några förkortningar. P står för storleken på potten (pot size), medan B är storleken på din satsning. Låt oss sätta sannolikheten (sett från din motståndares synvinkel) att du har den bästa handen till q. I vårt exempel P = $100, B = $100 samt q = 0,20. Om du inte gillar vårt antagande på 21%, får du gärna ändra denna siffran, tillvägagångssättet förblir det samma, endast resultatet kommer att skilja sig åt. På samma sätt kan du ändra storleken på potten och storleken på din satsning. Detta innebär att våra förkortningar även generaliserar problemet.
Vi måste på något sätt benämna våran bluffrekvens, samt vår motståndares synfrekvens när vi satsar. Låt det första vara x, det senare vara y. Det vill säga x innebär sannolikheten att vi bluffar. Till exempel, om vi bluffar med 30% sannolikhet (x=0,3), kommer vår bluffrekvens att vara 30% i det långa loppet. Liknande, innebär y sannolikheten att vår motståndare synar vår satsning.
Detta leder oss fram till att vi ursprungligen frågade efter det optimala värdet på x .
FÖRVÄNTAD AVKASTNING OCH TEORETISKA STRATEGIER
Till att börja med, låt oss gå tillbaka till starten. Vad är vårt mål med poker? Att vinna pengar. Mer precist, att vinna så mycket pengar som möjligt. Oavsett när vi tar ett beslut, frågar vi oss själva(eller åtminstone bör vi fråga oss), vilken linje ger den störst förväntande avkastningen.
I vårt exempel, om du hade den vinnande handen, skulle du satsa för värde. När du satsar kommer din motståndare antingen att syna din satsning (y delar av gångerna), eller att folda sin hand (1 -y andelar av gångerna). När han synar, kommer du att vinna potten, samt de pengar som din motståndare synar din satsning med: P + B. När han foldar vinner du endast den nuvarande potten: P. (`Nuvarande pott` hänvisar alltid till den ursprungliga pottstorleken, innan du satsade.) Om du hade den vinnande handen, kommer din förväntade avkastning Ew (w står för 'winning') att vara
Ew = y(P + B) + (1 – y)P.
För en hand som kommer att förlora vid showdown (ditt missade drag) blir det lite knepigare. Här gör du antingen en bluff (x delar av gångerna), eller ge upp handen och checkar (1 - x delar av gångerna).
Om du bluffar, kommer din motståndare antingen att syna din satsning (y delar av gångerna), eller att lägga sin hand (1 - y delar av gångerna). När han synar, kommer du att förlora din satsning, så din nettovinst är negativ: - B. När han foldar, vinner du den nuvarande potten: P. Så när du bluffar, beror din förväntade avkastning på dessa två fall, och är som följer
(1 – y)P – yB.
Om du checkar (bara ger upp), kommer du inte att vinna någonting, så i det fallet är din förväntade avkastning noll. Med dessa är din förväntade avkastning El (l står för `losing`) med din förlorande hand
El = (1 – x)0 + x[(1 – y)P – yB]
(genom att ha kombinerat fallen ovan med de motsvarande sannolikheterna).
Självklart är den första delen noll, och vi kan förkorta bort den, vilket ger oss
El = x[(1 – y)P – yB].
Om du vet att din motståndare aldrig synar (y = 0) – exempelvis om han ar tappat uppkopplingen - kommer din förväntade avkastning att bli:
El, y=0 = xP
För att maximera din förväntade avkastning måste du välja x = 1, vilket innebär att du alltid bör bluffa.
Å andra sidan, om du vet att din motståndare alltid synar (y = 1), kommer din förväntade avkastning att bli:
El, y=1 = – xB
För att maximera detta måste du nu välja x = 0, vilket innebär att du aldrig bör bluffa. (Räcker med att du kommer ihåg sägnen 'bluffa aldrig en synstation')
Pratat med spelteoretikerns språk, har vi nu räknat ut din bästa linje, genom att veta din motståndares strategi i två specialfall. Men dessa var extremfallen, de så kallade teoretiska strategierna. I det verkliga livet kommer din motståndare att vara mer oförutsägbar. Han kommer att syna din satsning med en särskild sannolikhet (inte 0 och inte 1). Inom spelteorin skulle man säga att han har en mixad strategi.
OPTIMALA STRATEGIER
Det är intressant att din motståndare kan välja en synfrekvens y, då din förväntade avkastning är den samma oavsett vilken strategi (det vill säga, oavsett x) du väljer. Låt oss sätta denna synfrekvens till yopt (som då är det optimala värdet på y).
Det är ganska enkelt att beräkna värdet av yopt. Om du är intresserad av detaljerna, kan du hitta dem i bilagan. Här är slutresultaten
yopt = P/(P + B).
I vårt exempel, P = B = $100, ger yopt = 1/2. Om din motståndare synar exakt hälften av gångerna, kan du inte utmanövrera honom. När din motståndare spelar enligt strategin y = yopt, kommer din förväntade avkastning att vara
El,y=yopt = x[PB/(P + B) – PB/(P + B)] = 0.
(Sätt bara vad vi fick fram för yopt in i den generella ekvationen som vi fick fram för El). Eftersom x inte finns med i ekvationen (faktiskt finns inget med, bara noll), oavsett vilken strategi (vilket x) du väljer, har du inte möjlighet att varken öka eller minska din förväntade avkastning.
Det är intressant att yopt endast beror på storleken på potten och storleken på satsningen. Den är oberoende q, till exempel. Detta visar att yopt inte är någon optimal av y universellt sett. Om till exempel q = 1. Exempelvis om din motståndare är säker på att du har den bästa handen, kommer han inte att syna dig hälften av gångerna - faktum är, att han inte kommer att syna någon gång. Då kommer han att välja en strategi som motsvarar y = 0. Vi kommer att se längre fram, i vilken bemärkelse yopt är optimal.
Liknande, kan du välja x på ett sådant sätt, att oavsett vilken strategi (vilket y) din motståndare väljer, kommer hans förväntade avkastning att förbli den samma. Liknande, kommer vi att benämna detta specialvärde av x som xopt. Men det är lite knepigare att få fram värdet av xopt. Vi hoppar detaljerna, detta är vad vi fick fram
xopt = qB/[(1 – q)(P + B)].
(Om du är intresserad av detaljerna, för att beräkna ovanstående uttryck behöver du först få fram {den förväntade avkastningen sett ur din motståndares synvinkel}. Med den, {få fram värdet av xopt} är enkelt.) Om du bluffar så här ofta med din förlorande hand, {kommer din motståndares förväntade avkastning} att vara
Eop = (1 – q)P – qPB/(P + B).
Eftersom det inte finns något y i denna formel, kan han helt enkelt inte ändra sin förväntade avkastning.
I vårt exempel P = B = $100 and q = 0,2, ger xopt = 1/8. Om du bluffar 1/8 av gångerna, kommer din motståndare inte att kunna spela ut dig, även om han är väldigt observant och vet om din strategi (det vill säga, vet att x = xopt). Om du bluffar mer sällan eller oftare, kommer din observanta motståndare att exploartera din strategi genom att hitta motsvarande bästa respons. Så om du möter en väldigt bra motståndare, kommer xopt med säkerhet att vara den mest optimala strategin för dig.
Hur ofta kommer en sådan väldigt bra motståndare att syna din satsning? Detta ges av yopt. Om du spelar enligt strategin där x = xopt, kan han faktiskt välja vilken strategi han vill. Vi såg att han inte kan öka (eller minska) sin förväntade avkastning. Men om han inte använder strategin där y = yopt, kan du som en observant spelare upptäcka hans misstag, och välja en optimal strategi mot hans. Den enda gången då du inte kan exploatera hans strategi är när han väljer y = yopt - nu oavsett vilken strategi du spelar efter, kommer din förväntade avkastning att vara den samma. Men se upp, om du väljer en annan strategi än xopt, kommer din motståndare att kunna exploatera ditt spel genom att därigenom ändra sin strategi
Nu ser vi i vilken mening xopt och yopt är optimala: de ger oexploaterbara strategier. I spelteori kallas sådana par av strategier (xopt, yopt) för Nash-jämvikt. Detta är ett väldigt viktigt koncept inom spelteori och ekonomi (ja, han är samma Nash som hjälten i filmer `A beautiful mind`, vinnaren av 1994 års Nobelpris i ekonomi!). Nu ser vi att han har en central roll även i pokerteori.
FÖRVÄNTAD AVKASTNING I NÅGRA SPECIALFALL
Låt oss avsluta med två tabeller som visar din förväntade avkastning i några specialfall. Den första tabellen visar din avkastning med ditt missade drag (förlorande hand), beräknat i det givna exemplet:
| Din strategi | Motståndarens strategi | Förväntad avkastning(El) | Anmärkningar |
| x = 0 | y = 0 | $0 | Om du är bakom. Om du inte bluffar, kan du inte vinna. |
| = 1 | $0 | ||
| y = yopt | $0 | ||
| x = 1 | y = 0 | $100 | Bluffa veka spelare! |
| y = 1 | - $100 | Bluffa aldrig en synstation! | |
| y = yopt | $0 | ||
| x = xopt | y = 0 | $12,5 | xopt är inte något `universellt optimum`. Om du vet att du kommer att bli synad, bluffa inte! |
| y = 1 | – $12,5 | ||
| y = yopt | $0 |
Din motståndares förväntade avkastning är din med motsatt tecken, plus de $100 som redan är i potten. (Han vinner din nettoförlust i satsningsrundan, plus den nuvarande potten. Självklart när du vinner potten, är din nettoförlust – $100 och han får inget. Eller ta det enklaste fallet: när din förväntade avkastning är noll, är din markerstack intakt - samma sak gäller i ögonblicket som riverkortet kommer. Trots att potten inte kan bli din, måste något få den - så den kommer att bli din motståndares. Inom spelteorin säger vi att vårt exempelspel - eftersom vi redan är på river - är ett noll-summa spel.)
Samtidigt som du vet när du bluffar och när du satsar för värde, vet inte din motståndare det. Så för honom (och troligtvis för dig med), är följande tabell mer instruktiv. Den ger din förväntade avkastning för en mix av vinnande och förlorande händer. I liknande situationer kommer du att vara före i 20% av gångerna, och bakom i 80% av gångerna. Din förväntade avkastning blir qEw + (1 – q)El. (Igen, det negativa av detta plus de $100 i den nuvarande potten ger din motståndares förväntade avkastning, Eop.)
| Din strategi | Motståndarens strategi | Förväntad avkastning | Anmärkningar |
| x = 0 | y = 0 | $20 | Detta är anledningen till att vi älskar synstationer! |
| y = 1 | $40 | ||
| y = yopt | $30 | ||
| x = 1 | y = 0 | $100 | Bluffa veka spelare! |
| y = 1 | - $40 | Bluffa aldrig en synstation! | |
| y = yopt | $30 | ||
| x = xopt | y = 0 | $30 | xopt är optimalt i den mening att din motståndare inte kan spela ut dig |
| y = 1 | $30 | ||
| y = yopt | $30 |
Sammanfattning
När du möter en bra motståndare, är ditt bästa val att använda strategin som ges av Nash-jämvikt: xopt. I detta fall kommer din motståndare att spela den strategi som ges av yopt. Om han inte gör detta, gör han ett misstag (det vill säga: han inte är en så bra spelare), och du kan exploatera hans misstag genom att hitta det bästa svaret mot hans strategi. Om han tenderar att syna för ofta, bluffa mindre. Om han synar dig för sällan, bluffa mer. Om du kan gissa rätt på hans synfrekvens, kan du beräkna hur mycket mer sällan (eller oftare) som du bör bluffa för att maximera din förväntade avkastning, precis som vi gjorde ovan.
Bilaga
Om y = yopt, kommer din förväntade avkastning att förbli den samma för alla värden av x. Låt oss till en början sätta x = 0. Här kan du inte vinna någonting, vilket även visas i formeln:
El, x=0 = 0.
Ta nu x = 1. Då ger vår ekvation för El
El, x=1 = (1 – yopt)P – yoptB.
Liksom för El, måste x=0 bli samma som för El, x=1, vi får
(1 – yopt)P – yoptB = 0,
vilket ger oss
(1 – yopt)P = yoptB,
P – yoptP = yoptB,
P = yopt(P + B),
och slutligen
yopt = P/(P + B).
{den förväntade avkastningen sett från din motståndares perspektiv}, {din motståndares förväntade avkastning}:
Låt oss nu ta en titt på handen sett från din motståndares synvinkel. Först skriver vi upp den förväntade avkastningen, Eop. Eftersom han – till skillnad från dig – inte vet ifall du är före eller bakom, kommer hans förväntade avkastning även att bero på q, vilket gör det hela lite mer komplicerat:
Eop = – qyB + q(1 – y)0 + (1 – q)[xy(P + B) + x(1 – y)0 + (1 – x)P].
Den första termen motsvarar det fall då du har den vinnande handen, du satsar och han synar, och förlorar därmed sin satsning. Den andra termen står för de fall när du har den vinnande handen och han foldar, och då varken vinner (eller förlorar) något. Resterande termer motsvarar de fall då han är före. Första delen inom hakparenteserna står för de fall då du han bluffar och han synar, vinner den nuvarande potten plus din satsning. Mellandelen motsvarar de fall då du bluffar och han foldar, förlorar/vinner inget, medan den sista termen står för de fall då du ger upp och han vinner potten (antingen genom att checka bakom, eller genom att tvinga dig att folda).
När vi förkortar bort de termer som blir lika med noll får vi kvar
Eop = (1 – q)[xy(P + B) + (1 – x)P] – qyB.
Om din motståndare visste att du aldrig bluffar (x = 0), vilket skulle bli hans bästa reaktion på det? Självklart skulle han aldrig att syna dig. Detta kan även ses i ekvationen ovan, om vi ersätter alla x med 0.
Eop x=0 = (1 – q)P– qyB.
För att maximera detta, måste vi välja y = 0 (aldrig syna).
Å andra sidan, om din motståndare visste att du alltid bluffade (x = 1), skulle den bästa reaktionen inte att vara lika uppenbar. Då x = 1 får vi
Eop x=1 = (1 – q)y(P + B) – qyB = y[(1 – q)(P + B) – qB].
om
(1 – q)(P + B) – qB > 0,
y = 1 (alltid syna) kommer att maximera din motståndares förväntade avkastning.
om
(1 – q)(P + B) – qB < 0,
skulle han istället välja y = 0 (aldrig syna).
(1 – q)(P + B) – qB < 0
vilket innebär
(1 – q)(P + B) < qB,
P + B – qP – qB < qB,
P + B < q(P + 2B),
som slutligen ger
q > (P + B)/(P + 2B).
I vårt exempel, där P = B = $100, om q > 2/3, bör din motståndare aldrig syna din satsning (även om han vet att du alltid satsar; och därför bör du alltid bluffa i sådana fall), medan om q < 2/3, bör han alltid syna (om han vet att du alltid bluffar). Notera att detta specialvärde på q bara beror på pottstorleken och storleken på satsningen.
Om x = xopt, kommer din motståndares förväntade avkastning att vara samma för alla värden av y. Som tidigare, låt oss först ta y = 0. Ekvationen för Eop ger oss
Eop y=0 = (1 – q)(1 – xopt)P.
Låt oss nu ta y = 1. Denna gången får vi
Eop y=1 = (1 – q)[ xopt (P + B) + (1 – xopt)P] – qB.
Eftersom Eop y=0 måste bli samma som Eop y=1, får vi
(1 – q)(1 – xopt)P = (1 – q)[ xopt (P + B) + (1 – xopt)P] – qB,
vilket ger oss
qB = (1 – q) xopt (P + B)
((1 – q)(1 – xopt)P finns på båda sidor, vi hoppar över detaljerna), slutligen får vi
xopt = qB/[(1 – q)(P + B)].
| Förkortning | Betyder | Värde i vårt exempel |
| P ($) | Storleken på potten | 100 |
| B ($) | Storleken på din satsning | 100 |
| q | Sannolikheten att du har den vinnande handen (sett från din motståndares synvinkel) |
0,2 |
| x | Din bluffrekvens | (variabel) |
| y | Motståndarens synfrekvens | (variabel) |
| xopt | Din 'optimala' bluffrekvens | 0,125 |
| yopt | Motståndarens 'optimala' synfrekvens | 0,5 |
| Ew ($) | Din förväntade avkastning då du har den vinnande handen | 100 (1 + y) |
| El ($) | Din förväntade avkastning då du har den förlorande handen |
100x (1 – 2y) |
| Eop ($) | Motståndarens förväntade avkastning | 80[2xy + 1 – x] – 20y |
1 När vi arbetar med sannolikheter, skriver vi oftast 0,2 istället för 20%, 0,5 istället för 50% osv. När vi sätter det så här är sannolikheten för en omöjlig händelse 0 (0%), medan en 'säker sak' har sannolikheten 1 (100%). Sannolikheten i alla andra fall måste hamna mellan 0 och 1.